# Fireworks 发布 Ember-1：推理 token 砍掉四成，Kimi K3 的答题质量还在

> 原标题：Fireworks Research 发布 Ember-1，以更少推理 token 保持 Kimi K3 质量

- 来源：AI HOT 精选
- 发布时间：2026-09-23T21:40:50.983Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58473
- 原文：https://fireworks.ai/blog/ember-1

## 摘要

Fireworks Research 基于 Kimi K3 训了个新模型 Ember-1，把推理时产生的内部思考 token 压掉了 35% 到 50%，但准确率没掉。他们跑了 50 多次训练实验，发现 K3 超过九成的 token 都花在内部推理上，其中很多是多余的。Ember-1 保留了有用的自我纠错，跳过了没产出的思考循环。在多轮 agent 任...

## 推荐理由

Fireworks 把 Kimi K3 蒸馏成 Ember-1，推理 token 压掉 35% 到 50%，准确率持平，有 50 多次训练实验和客户实测数据撑腰。分数没给更高，是因为这本质上是对现有模型的优化，不是新能力发布，而且 Fireworks 自己就是推理服务商，我会先打个折看后续第三方复现。

## 锐评

Fireworks 基于 Kimi K3 训了个新模型 Ember-1，核心就一件事：把模型在给出答案前“自言自语”的思考 token 砍掉 35% 到 50%，但准确率基本持平。他们发现 K3 超过九成的 token 都花在内部推理上，很多是重复或没产出的循环。Ember-1 保留了有用的自我纠错，跳过了那些没用的部分。

这个优化在单次问答里省的钱不算夸张，但在多轮 agent 任务里优势会放大，因为每一轮都要把之前的思考历史重新读一遍，成本是滚雪球的。他们跑了 50 多次训练实验，在 7 个基准测试和两家客户的线上 A/B 测试里验证了质量没掉。

不过要注意，这本质上是个“瘦身版”K3，不是能力更强的模型。它解决的是成本问题，不是智商问题。正文没披露具体训练数据和方法细节，也没说这种压缩是否在某些复杂推理任务上有盲区。如果你现在用 K3 觉得太贵，这是个值得试的平替；如果追求更高上限，它给不了你。
