# Fireworks AI 把 Kimi K3 的推理 Token 砍掉约 40%，做出 Ember-1

> 原标题：Fireworks AI 发布 Ember-1：基于 Kimi K3 的后训练模型，推理 Token 减少约 40%

- 来源：AI HOT 精选
- 发布时间：2026-09-28T07:22:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59424
- 原文：https://www.marktechpost.com/2026/09/28/fireworks-ai-releases-ember-1-a-post-trained-kimi-k3-that-uses-about-40-fewer-tokens/

## 摘要

Fireworks AI 对 Kimi K3 做了一轮后训练，得到新模型 Ember-1。它把推理时产生的 token 量减少了大约 40%，但准确率没掉。K3 有时会把超过 90% 的 token 花在内部推理上，在多轮 agent 任务里成本会滚雪球。Ember-1 保留了有用的自我纠错，砍掉了重复绕圈的部分。在 Terminal Bench 2....

## 推荐理由

这篇讲的是 Fireworks AI 拿 Kimi K3 做后训练，把推理 token 压了约 40% 但准确率没掉。我会先打个折——它不是新基座模型，是第三方微调，而且来源是 MarktechPost 的转述，不是一手技术报告。但它的 hook 很实在：K3 内部推理 token 占比能超过 90%，Ember-1 砍掉的是重复绕圈的部分，保留了自我纠错，这对跑 agent 工作流的人直接意味着成本下降。正文没披露具体训练方法和完整评测集，这点先别太激动，但作为一条实用信息，值得推给关注推理效率的读者。

## 锐评

Fireworks AI 对 Kimi K3 做了一轮后训练，搞出个新模型 Ember-1。核心卖点是推理时产生的 token 量少了约 40%，但准确率没掉。K3 有个毛病，有时会把超过 90% 的 token 花在内部推理上，在多轮 agent 任务里成本会滚雪球。Ember-1 的做法是保留有用的自我纠错，砍掉重复绕圈的部分。在 Terminal Bench 2.1 上，Ember-1 拿了 82% 的分数，比 K3 火力全开时还高 1.1 分，同时成本低了 51.9%。

这点先别太激动。Fireworks 没公开模型权重和训练代码，只通过自家 serverless API 提供服务。也就是说，你没法自己部署验证，也没法看它具体怎么训的。正文没披露训练数据、算力消耗和具体后训练方法，这些信息缺口让“省钱”这个结论只能先打个折。

对做 agent 应用的团队来说，如果 API 价格确实便宜，且延迟更低，那值得试试。但如果你需要私有化部署或想复现这套方法，目前这条路是堵死的。
