让大模型学会省力思考:低、中、高三档推理模式怎么训出来
Controlling Reasoning Effort in LLMs
Sebastian Raschka 在这篇文章里讲了一种训练方法,让同一个推理模型能按需切换思考强度,而不是每次都全力运转。他先用 GPT-5.6 的五档推理设置引出话题,然后明确推理模型的定义:会输出中间步骤、一步步推演的模型。核心做法分两步:训练时用强化学习加可验证奖励(RLVR),推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推...
推荐理由:Raschka 讲了一种训练方法,让同一个推理模型能按需切换思考强度。文章先把 GPT-5.6 的五档推理设置当引子,然后给出推理模型的定义——会输出中间步骤、一步步推演的模型。核心做法分两步:训练时用强化学习加可验证奖励,推理时靠 token 预算来控制生成长度。具体操作是把不同长度的推理链混在一起训,让模型学会根据预算指令调整输出。我会先打个折:正文没披露具体实验数据和效果对比,这点先别太激动。但思路本身对想省推理成本又有灵活需求的团队有参考价值。