Kimi K3 在 AA-Briefcase 智能体知识工作评测中排第二,但跑一次任务要花 10 美元、等近一小时
Kimi K3: second only to Fable 5 on AA-Briefcase
月之暗面的 Kimi K3(2.8 万亿参数)在 AA-Briefcase 评测里拿到 1543 的 Elo 分,比上一代 K2.6 高了 727 分,仅次于 Claude Fable 5 的 1574 分。它的客观正确率和分析质量跟 Fable 5 打得有来有回,但做出来的东西在呈现质量上不如 GPT-5.6 Sol 和 Opus 4.8 好看。真正...
推荐理由:Kimi K3 在 AA-Briefcase 上拿了 1543 Elo,只比 Claude Fable 5 少 31 分,比上一代 K2.6 猛涨 727 分,客观正确率和分析质量跟 Fable 5 有来有回。我会先打个折:这是第三方评测,不是官方跑分,而且呈现质量不如 GPT-5.6 Sol 和 Opus 4.8 好看,说明模型能答对但包装还不够漂亮。正文给了 2.8 万亿参数、成本和延迟数字,信息量够,不是纯吹牛。分数定在 82 不往上拉,因为还没看到更多独立复现和实际业务场景的验证,但这件事本身对国内做 agent 落地的人是个值得盯的信号。