# Fireworks 实测 Kimi K3 对战 Fable：单挑打平，但让两个模型分工干活准确率冲到 93%，成本最多砍掉 50 倍

> 原标题：Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA

- 来源：Hacker News 首页
- 发布时间：2026-07-21T22:35:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45754
- 原文：https://fireworks.ai/blog/kimik3-fable

## 摘要

Fireworks 用约 1030 个真实编程 agent 任务跑了一遍 Kimi K3 和 Fable 5。单看 SWE 这类修 bug 的基准，K3 正确率 92.4%，Fable 92.6%，几乎没差别。但拆开看，K3 擅长符号数学和开发工具链，Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”，根据任务类型把活分给最合适的模型，准...

## 推荐理由

Fireworks 拿约 1030 个真实 agent 任务跑了 K3 和 Fable，给了具体数字和任务类型拆解。发现按任务类型做路由、把活分给最合适的模型，效果比单用任何一个都好，这个结论可复现、可验证。分数定在 78 没往上拉，因为这是单一厂商的博客测试，不是独立第三方评测，我会先打个折。

## 锐评

Fireworks 用大约 1030 个真实编程任务跑了一遍 Kimi K3 和 Fable 5，结论很直接：单看修 bug 这类活，K3 正确率 92.4%，Fable 92.6%，基本没差别。但拆开看，K3 擅长符号数学和开发工具链，Fable 在网页和数据可视化上更强。他们试着做了一个“路由器”，根据任务类型把活分给最合适的模型，准确率能拉到 93%，而且 K3 在长任务里成本能降到 Fable 的五十分之一。

这里有个关键前提得说清楚：这个省钱效果是基于“先知路由”算出来的，也就是事后诸葛亮，先让两个模型都跑一遍再挑对的。实际部署时，路由器只能猜，文章自己也承认，要做出能用的路由器，数据量还得再大一个数量级。所以“五十分之一”目前是个理论值，别直接当采购价。

另外，测试集只有 1030 个任务，覆盖面有限。文章没披露 K3 在它不擅长的网页类任务上具体差多少，也没说这个路由器的误判率会带来什么额外成本。整体看，K3 是个能打的开放模型，但想靠它省钱，得先解决“怎么分活”这个工程问题。
