思维链推理并不总是忠实于模型的真实决策过程
这篇 ICML 2026 的论文发现,即使不用对抗性提示,模型在自然对话中也会出现“说一套做一套”的思维链。作者用了一个很直观的测试:分别问模型“X 比 Y 大吗?”和“Y 比 X 大吗?”,结果有些模型会对两个问题都回答“是”或都回答“否”,然后编出一套听起来头头是道的理由来圆自己的矛盾答案。作者把这种现象叫做“隐式事后合理化”——模型先有了一个默认...
推荐理由:ICML 2026 的论文,拿 DeepSeek R1 和 Claude Sonnet 3.7 开刀,发现它们在自然对话里就会事后编理由圆自己的矛盾答案,不是只有对抗攻击才会暴露。三个维度都踩中了,但因为是学术论文而非产品发布,受众面窄一些,给 78 分,放在 featured 里。