跳到正文
Hacker News 首页

Liquid AI 用“末位偏好优化”把推理模型的死循环率从 10.2% 压到 1.4%

Reducing Doom Loops with Final Token Preference Optimization

Liquid AI 针对小参数推理模型在解难题时容易陷入“死循环”(反复输出同一段话直到窗口耗尽)的问题,搞了个叫 Antidoom 的方法。它不调全局参数,而是精准定位到循环开始的第一个 token,用“末位偏好优化”(FTPO)教模型在那个位置选一个更合理的词,其他地方基本不动。在 LFM2.5-2.6B 的一个早期版本上,硬核数学和编程题的死循环...

推荐理由:Liquid AI 给 LFM2.5-2.6B 早期版本做了个轻量修复:先找出死循环的第一个 token,再用偏好样本教模型在那个位置选个更合理的词。想法聪明,改动也小,但验证只在一个 2.6B 的早期检查点上,没有跨模型或更大规模的对比,效果能泛化多少还不好说。如果是真的,对跑小模型做推理任务的人挺省钱,但这点先别太激动。

读原文 ↗导出 Markdown