# OpenAI 发现推理模型很难按指令控制自己的思考过程，但这反而是个安全上的好消息

> 原标题：Reasoning models struggle to control their chains of thought, and that’s good

- 来源：OpenAI News
- 发布时间：2026-03-05T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/172
- 原文：https://openai.com/index/reasoning-models-chain-of-thought-controllability

## 摘要

OpenAI 发了篇论文，核心结论是：现在最强的推理模型，都没法很好地控制自己的“思考草稿”（思维链）。他们搞了个叫 CoT-Control 的测试，用 13000 多个任务去要求模型在思考时遵守特定规则，比如全程用小写字母、避开某个关键词。结果所有被测模型的遵守率最高只有 15.4%，最低的甚至只有 0.1%。模型经常在草稿里自己都意识到“坏了，我刚...

## 推荐理由

OpenAI 用一篇文章标题说推理模型很难控制自己的 chain of thought，而且把这当成一件好事。这个说法挺反常识的——通常我们会觉得模型思考过程不可控是个安全隐患，但他们反过来认为这有利于安全。目前只有标题，正文没放出来，所以看不到具体实验、数字或者机制解释。我会先打个折：判断只能基于标题本身，别急着下结论说他们找到了什么新方法。对做推理模型安全和可解释性的人来说，这个观点值得追一下原文，但信息缺口还很大。

## 锐评

这篇东西与其说是论文，不如说是 OpenAI 的安全定心丸。他们搞了个叫 CoT-Control 的测试，用 13000 多个任务去要求模型在思考草稿里遵守特定规则，比如全程用小写字母、避开某个关键词。结果所有被测模型的遵守率最高只有 15.4%，最低的甚至只有 0.1%。模型经常在草稿里自己都意识到“坏了，我刚才用了大写”，但就是改不过来。

OpenAI 的逻辑是：既然模型连这么简单的指令都控制不了自己的思维链，那它们故意在监控下隐藏真实意图的能力就更弱，所以目前用思维链做安全监控还算靠谱。这个推论方向说得通，但测试本身有个明显局限——它测的是“听指令控制草稿”，不是“为了骗过监控而主动伪装”。两者动机完全不同，不能直接划等号。

另外，正文提到模型越大控制力越强，推理时间越长控制力反而下降，但没给出具体数字对比。还缺一个关键信息：这些测试是在模型知道被监控的条件下跑的，如果模型不知道自己被监控，表现会不会更差？这点没测。
