# Liquid AI 用“末位偏好优化”把推理模型的死循环率从 10.2% 压到 1.4%

> 原标题：Reducing Doom Loops with Final Token Preference Optimization

- 来源：Hacker News 首页
- 发布时间：2026-07-07T16:31:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42943
- 原文：https://www.liquid.ai/blog/antidoom

## 摘要

Liquid AI 针对小参数推理模型在解难题时容易陷入“死循环”（反复输出同一段话直到窗口耗尽）的问题，搞了个叫 Antidoom 的方法。它不调全局参数，而是精准定位到循环开始的第一个 token，用“末位偏好优化”（FTPO）教模型在那个位置选一个更合理的词，其他地方基本不动。在 LFM2.5-2.6B 的一个早期版本上，硬核数学和编程题的死循环...

## 推荐理由

Liquid AI 给 LFM2.5-2.6B 早期版本做了个轻量修复：先找出死循环的第一个 token，再用偏好样本教模型在那个位置选个更合理的词。想法聪明，改动也小，但验证只在一个 2.6B 的早期检查点上，没有跨模型或更大规模的对比，效果能泛化多少还不好说。如果是真的，对跑小模型做推理任务的人挺省钱，但这点先别太激动。

## 锐评

这条值得点开看，因为它解决了一个小模型推理时的真实痛点：解难题解到一半开始复读机，直到把上下文窗口耗光。Liquid AI 的办法很取巧，不调整个模型，而是精准定位到死循环开始的第一个 token，用“末位偏好优化”（FTPO）教模型在那个位置选个更合理的词。在 LFM2.5-2.6B 的一个早期版本上，硬核数学和编程题的死循环率从 10.2% 降到了 1.4%，评测分数也跟着涨了。

方法本身借鉴了 Antislop，用单 token 的偏好对来训练，比强化学习需要的在线采样便宜很多。文章把死循环的成因拆得挺清楚：某些词在训练数据里被过度强化（比如“Wait”、“Alternatively”），模型一卡壳就容易滑向这些词，加上前文重复会自我强化，再配合低温度贪婪解码，死循环就焊死了。

不过正文没披露训练算力开销和推理延迟的影响。这点先别太激动，毕竟只在一个 2.6B 的早期检查点上验过，换别的模型或更大尺寸效果会不会打折还不清楚。另外，它只改了循环起点的 token，如果模型在别的位置卡出新的死循环模式，这套方法可能还得再补丁。
