# Kimi K3 在 AA-Briefcase 智能体知识工作评测中排第二，但跑一次任务要花 10 美元、等近一小时

> 原标题：Kimi K3: second only to Fable 5 on AA-Briefcase

- 来源：Hacker News 首页
- 发布时间：2026-07-22T04:33:44.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45873
- 原文：https://artificialanalysis.ai/articles/kimi-k3-agentic-knowledge-benchmark

## 摘要

月之暗面的 Kimi K3（2.8 万亿参数）在 AA-Briefcase 评测里拿到 1543 的 Elo 分，比上一代 K2.6 高了 727 分，仅次于 Claude Fable 5 的 1574 分。它的客观正确率和分析质量跟 Fable 5 打得有来有回，但做出来的东西在呈现质量上不如 GPT-5.6 Sol 和 Opus 4.8 好看。真正...

## 推荐理由

Kimi K3 在 AA-Briefcase 上拿了 1543 Elo，只比 Claude Fable 5 少 31 分，比上一代 K2.6 猛涨 727 分，客观正确率和分析质量跟 Fable 5 有来有回。我会先打个折：这是第三方评测，不是官方跑分，而且呈现质量不如 GPT-5.6 Sol 和 Opus 4.8 好看，说明模型能答对但包装还不够漂亮。正文给了 2.8 万亿参数、成本和延迟数字，信息量够，不是纯吹牛。分数定在 82 不往上拉，因为还没看到更多独立复现和实际业务场景的验证，但这件事本身对国内做 agent 落地的人是个值得盯的信号。

## 锐评

Kimi K3 在 AA-Briefcase 这个模拟真实知识工作的评测里拿了 1543 分，确实只比 Claude Fable 5 低 31 分，比上一代 K2.6 猛涨了 727 分。它的客观正确率和分析质量跟 Fable 5 打得有来有回，说明模型本身的分析底子不差。

但一跑起来问题就暴露了：平均每项任务要花 56 分钟、烧掉 10.57 美元，比 Fable 5 慢 2.5 倍，比 Opus 4.8 还贵。贵和慢主要来自它太“话痨”——平均每项任务要跟工具交互 83 轮，吐出 12 万 token 的输出，而 Fable 5 只要 67 轮。另外它做出来的东西在呈现质量上不如 GPT-5.6 Sol 和 Opus 4.8 好看，说明能干活但交付物不够精致。

正文没披露具体是什么类型的任务让它轮次这么高，也没说这 10 美元花在哪些环节。如果大部分成本是反复调用工具、自己给自己纠错，那后续优化空间可能不小。但眼下这个成本和时间，只适合那种“宁可等一小时也要结果对”的场景，离日常高频使用还有距离。
