Fireworks 发布 Ember-1:推理 token 砍掉四成,Kimi K3 的答题质量还在
Fireworks Research 发布 Ember-1,以更少推理 token 保持 Kimi K3 质量
Fireworks Research 基于 Kimi K3 训了个新模型 Ember-1,把推理时产生的内部思考 token 压掉了 35% 到 50%,但准确率没掉。他们跑了 50 多次训练实验,发现 K3 超过九成的 token 都花在内部推理上,其中很多是多余的。Ember-1 保留了有用的自我纠错,跳过了没产出的思考循环。在多轮 agent 任...
推荐理由:Fireworks 把 Kimi K3 蒸馏成 Ember-1,推理 token 压掉 35% 到 50%,准确率持平,有 50 多次训练实验和客户实测数据撑腰。分数没给更高,是因为这本质上是对现有模型的优化,不是新能力发布,而且 Fireworks 自己就是推理服务商,我会先打个折看后续第三方复现。