# RL 训练大模型有个马太效应：难题越练越少，这篇博客提出“永不放弃”来纠正它

> 原标题：Learning to solve hard problems in RL for LLMs by never giving up

- 来源：Hacker News 首页
- 发布时间：2026-09-15T19:07:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56763
- 原文：https://mnoukhov.github.io/posts/ngu/

## 摘要

Michael Noukhovitch 写了篇博客介绍他新论文里的发现：用强化学习（RL）做模型后训练时，会出现马太效应——训练越往后，模型越爱挑简单题做，难题被采样的次数越来越少，因为早期在简单题上拿到的奖励把训练方向带偏了。他提出的修正方法叫 Never Give Up（NGU），核心是给难题设一个最低采样比例，不让它们被挤掉。在 Olmo 3.1...

## 推荐理由

Michael Noukhovitch 把自家论文写成了博客，讲的是 RL 后训练里一个隐蔽的退化现象：模型会越来越爱做简单题，难题采样率一路下滑，因为早期简单题的奖励把训练方向带偏了。他管这个叫马太效应，提出的修正方案 NGU 就是给难题设最低采样比例，强制保留训练信号。正文没披露 NGU 在 Olmo 3.1 之外更多模型上的验证结果，这点先别太激动，但思路本身对正在跑 RL 流程的团队有直接参考价值。

## 锐评

Michael Noukhovitch 这篇博客讲的是强化学习后训练里的一个老毛病：模型越训越爱挑软柿子捏。他发现训练后期，简单题因为早期奖励高，被反复采样，难题的采样次数越来越少，他把这叫做马太效应。他提出的修正方法叫 Never Give Up（NGU），说白了就是给难题设一个最低采样比例，强制模型不能放弃它们。在 Olmo 3.1 7B 的数学训练上，AIME 2025 的 pass@1 从 26.7% 提到了 33.3%；代码任务 LiveCodeBench 从 23.4% 提到了 26.1%。数字看着不错，但正文没披露 NGU 的具体超参数和额外算力开销，所以这些收益得打个折看。另外，他把马太效应归为一种“首因偏差”，这个类比挺直观，但论证还比较浅。如果后续能补上成本数据和更大规模的验证，这个方法的实用性会更清楚。
