跳到正文
新智元 · 公众号

用 token 级价值函数控制回答长度,3B 模型在长度控制上跑赢 GPT-5.4 和 Claude

token级,精准控制生成长度:3B模型击败GPT 5.4、Claude

加州大学圣塔芭芭拉分校和苹果的研究人员搞了个叫 LenVM 的方法,把“还剩多少 token 要生成”建模成一个 token 级别的价值函数,相当于给模型装了个实时字数进度条。他们拿 Qwen2.5-3B 搭配一个 1.5B 的 LenVM 去测 LIFEBench 的长度控制任务,得分 62.6,而 GPT-5.4 只有 37.4,Claude-Op...

推荐理由:我会先打个折:正文没披露 GPT-5.4 的具体版本和测试条件,这点先别太激动。但 LenVM 的思路很实用——把“还要写多长”变成一个 token 级的值函数,让 Qwen2.5-3B 搭配一个 1.5B 的小模型就能在长度控制上大幅领先大模型。LIFEBench 长度得分 62.6 比 GPT-5.4 的 37.4 高出不少,说明在特定任务上小模型加对方法可以很省钱。对做推理优化和想摆脱闭源模型绑定的团队来说,这是个值得跟的信号。

读原文 ↗导出 Markdown