# 让大模型学会省力思考：低、中、高三档推理模式怎么训出来

> 原标题：Controlling Reasoning Effort in LLMs

- 来源：Hacker News 首页
- 发布时间：2026-07-20T14:35:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45481
- 原文：https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms

## 摘要

Sebastian Raschka 在这篇文章里讲了一种训练方法，让同一个推理模型能按需切换思考强度，而不是每次都全力运转。他先用 GPT-5.6 的五档推理设置引出话题，然后明确推理模型的定义：会输出中间步骤、一步步推演的模型。核心做法分两步：训练时用强化学习加可验证奖励（RLVR），推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推...

## 推荐理由

Raschka 讲了一种训练方法，让同一个推理模型能按需切换思考强度。文章先把 GPT-5.6 的五档推理设置当引子，然后给出推理模型的定义——会输出中间步骤、一步步推演的模型。核心做法分两步：训练时用强化学习加可验证奖励，推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推理链混在一起训，让模型学会根据预算指令调整输出。我会先打个折：正文没披露具体实验数据和效果对比，这点先别太激动。但思路本身对想省推理成本又有灵活需求的团队有参考价值。

## 锐评

这篇文章讲的是让同一个推理模型学会“看人下菜碟”：简单题少想，难题多想。Raschka 的做法很直接，训练时把不同长度的推理过程混在一起，再给模型塞几个预算标签（比如 <|low|>、<|high|>），让它学会根据标签控制输出长度。他用 DeepSeek-R1-Distill-Qwen-32B 做微调，只用了 1040 组偏好数据，在 GSM8K 数学题上效果不错：低强度模式省了 40% 的 token，准确率只掉了 1.5%；高强度模式多花 2.3 倍的 token，换来 2.1% 的提升。

这个结果挺实在，说明用很小的数据量就能让模型学会控制思考深度，对成本和延迟控制很有吸引力。但得打个折：实验只跑了数学题，换到写代码、做逻辑推理或者开放域问答上能不能保持这个效果，正文没给结论。另外，训练用的是 DPO（偏好对齐），不是 RLVR，这和开头提到的强化学习路线不完全一样，作者也没解释为什么选这条路。如果未来模型能自己判断题目难度、自动选强度，实用性会再上一个台阶，但目前还只是手动设预算的阶段。
