# 只喂小学教材的模型，天花板就钉在小学

> 原标题：What happens when an LLM never sees material beyond fifth grade?

- 来源：Hacker News 首页
- 发布时间：2026-08-16T07:37:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50996
- 原文：https://littlelearner-ll.github.io/

## 摘要

这篇论文做了一个很干净的实验：把训练语料严格限制在美国K-5（小学）课程范围内，总共880亿token，从零开始训了三个尺寸的模型（最大50亿参数），同时训了不限制语料的对照组。结果发现，不管怎么把模型尺寸放大、用GRPO做强化学习后训练、或者给示例做上下文学习，模型在小学范围内的表现确实会变好，但超出小学范围的能力几乎纹丝不动。论文的核心判断是，预训...

## 推荐理由

实验设计干净，结论反直觉：模型尺寸放大、加GRPO强化学习后训练、给示例做上下文学习，都没能突破预训练语料的边界。这对做预训练和数据混合的人是个直接信号。没给更高分是因为这是研究论文而非产品发布，受众偏技术，但实验本身的说服力很强。

## 锐评

这个实验把大模型训练里一个模糊的问题讲清楚了：后训练到底是在教新东西，还是只是把模型本来就会的激发出来？他们从零开始，用880亿个token的K-5教材训了三个尺寸的模型，最大50亿参数，同时有不受限的对照组。结果很直接，不管怎么把模型尺寸放大、用GRPO做数学强化训练，或者给示例做上下文学习，模型在小学范围内的表现确实会变好，但超出小学范围的能力几乎纹丝不动。论文的核心判断是，预训练的数据边界就是模型能力的有效天花板，后训练更像是在这个天花板下面挖掘潜力，而不是往上盖楼。

这个结论对现在行业里砸钱做后训练的思路是个提醒。不过要注意，实验用的是从零开始训的模型，不是现在常见的在通用大模型上继续训。正文没披露如果在一个已经见过海量数据的模型上做类似限制，结论会不会变。另外，GRPO训练用的是数学题，其他类型的能力比如逻辑推理是不是也这样，论文没展开。这点先别急着往所有场景推广。
