Fireworks AI 把 Kimi K3 的推理 Token 砍掉约 40%,做出 Ember-1
Fireworks AI 发布 Ember-1:基于 Kimi K3 的后训练模型,推理 Token 减少约 40%
Fireworks AI 对 Kimi K3 做了一轮后训练,得到新模型 Ember-1。它把推理时产生的 token 量减少了大约 40%,但准确率没掉。K3 有时会把超过 90% 的 token 花在内部推理上,在多轮 agent 任务里成本会滚雪球。Ember-1 保留了有用的自我纠错,砍掉了重复绕圈的部分。在 Terminal Bench 2....
推荐理由:这篇讲的是 Fireworks AI 拿 Kimi K3 做后训练,把推理 token 压了约 40% 但准确率没掉。我会先打个折——它不是新基座模型,是第三方微调,而且来源是 MarktechPost 的转述,不是一手技术报告。但它的 hook 很实在:K3 内部推理 token 占比能超过 90%,Ember-1 砍掉的是重复绕圈的部分,保留了自我纠错,这对跑 agent 工作流的人直接意味着成本下降。正文没披露具体训练方法和完整评测集,这点先别太激动,但作为一条实用信息,值得推给关注推理效率的读者。