# GPT-5.5 的推理卡在 516 个 token：模型“想”的那一层会单独坏掉

> 原标题：GPT-5.5 的推理卡在 516 个 token：模型"想"的那一层会单独坏掉

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-09T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43534
- 原文：https://yage.ai/share/gpt55-codex-reasoning-clustering-20260709.html

## 摘要

开发者 vguptaa45 审计了 39 万条 Codex 响应，发现 GPT-5.5 在 44% 的编程任务里，推理部分刚好在 516 个 token 处截断，而 GPT-5.4 是 19.8%，GPT-5.2 只有 0.34%。被截断的任务全部答错，同一道题如果完整跑完 6000 到 8000 个 token 则全对。社区复现后，在 prompt ...

## 推荐理由

开发者 vguptaa45 翻查了 39 万条 Codex 回复，发现 GPT-5.5 在 44% 的编程任务里，推理部分会精准地在第 516 个 token 处断掉，断掉的题全错，而同一道题让它完整跑完 6000 到 8000 个 token 就全对。对比 GPT-5.4 的 19.8% 和 GPT-5.2 的 0.34%，这个 bug 像是新版本引入的。社区复现后找到了临时绕过的方法，对日常靠它写代码的人有直接参考价值。没给更高分是因为这更像一个具体版本的质量缺陷，影响面暂时局限在 Codex 的推理环节，正文没披露 OpenAI 是否已确认或修复。

## 锐评

这事最值得关注的点不是 GPT-5.5 变笨了，而是模型多出来的“思考层”会以一种传统评测完全看不见的方式坏掉。开发者 vguptaa45 审计了 39 万条 Codex 响应，发现 GPT-5.5 在 44% 的任务里推理刚好截断在 516 个 token，而 GPT-5.2 只有 0.34%。被截断的任务全部答错，同一道题如果完整跑完 6000 到 8000 个 token 则全对。社区复现后，在 prompt 里加一句“THIS IS HARD”就能绕过截断，指向的是系统内部的预算分类偏差，而不是模型能力退化。

同一周 Liquid AI 发布的 Antidoom 解决的是相反的毛病——模型陷入自我推翻的死循环。一个想太少，一个想太多，病根都在推理层。厂商的 pass-rate 评测只看最终答案对不对，516 截断的错答案和正常思考的错答案在分数上没区别，所以这个问题在内部评测里跑了几个月都没被发现。

正文没披露这 39 万条数据的具体任务类型分布，也没说明 516 聚簇是否只在特定编程语言或难度区间出现。OpenAI 官方还没给出最终结论，issue 作者自己也声明不主张这一定证明了隐藏截断存在。目前只有单一报告者的聚合数据，需要更多独立复现来确认机制。如果你在用 coding agent 跑长会话，现在就该去翻本地 log 画 reasoning token 的直方图，别等厂商修。
