# 一张草稿纸，一个 Controller：重新理解大模型推理

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-01T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48195
- 原文：https://yage.ai/share/reasoning-scratchpad-controller-20260801.html

## 摘要

推理模型并没有长出会思考的新大脑。Chain of Thought 先给 Transformer 一张只能往后写、不能往回擦的草稿纸，把原本挤在单次前向传播里的隐层心算，平摊到几十上百个自回归时间步上；后训练再练出一个 Controller，决定什么时候在草稿纸上检查、回退、换路或停笔。s1 的 Wait 实验和 pass@k 衰减测试都指向同一个结论...

## 推荐理由

这篇文章不是新论文或产品发布，而是一篇机制解读，但解读质量很高。它用草稿纸和控制器两个比喻把 Chain of Thought 和后训练的分工讲清楚了，还挂了 s1 的实验数据，不是空对空。H 轴靠比喻和机制拆解拿满，K 轴有具体实验支撑，R 轴因为好懂且有料，转发动力强。整体是评论向的优质内容，不是一手发布，所以分数落在 78 这个区间，不往上拔。

## 锐评

这篇文章把推理模型的底层机制讲得很透：自回归生成就是一张只能往后写、不能往回擦的草稿纸，Chain of Thought 把原本挤在单次前向传播里的隐层计算，平摊到了几十上百个时间步上。后训练练出来的 Controller 负责在这张纸上检查、回退、换路和停笔，而不是在权重里发明了什么新算法。s1 的 Wait 实验和 pass@k 衰减测试都指向同一个结论——强化学习做的是概率重排，不是创造新能力。

文章引用的消融实验很关键，但正文没披露这些实验的具体模型规模和任务范围，比如 s1 的 1000 条微调样本是否覆盖了足够多的推理类型。另外，Controller 在遇到完全陌生的推理任务时，回退和换路策略会不会退化，这点也没展开。如果是真的像作者说的只是概率重排，那推理能力的上限还是被预训练数据锁死的，这点先别太激动。
