跳到正文
Hacker News 首页

只喂小学教材的模型,天花板就钉在小学

What happens when an LLM never sees material beyond fifth grade?

这篇论文做了一个很干净的实验:把训练语料严格限制在美国K-5(小学)课程范围内,总共880亿token,从零开始训了三个尺寸的模型(最大50亿参数),同时训了不限制语料的对照组。结果发现,不管怎么把模型尺寸放大、用GRPO做强化学习后训练、或者给示例做上下文学习,模型在小学范围内的表现确实会变好,但超出小学范围的能力几乎纹丝不动。论文的核心判断是,预训...

推荐理由:实验设计干净,结论反直觉:模型尺寸放大、加GRPO强化学习后训练、给示例做上下文学习,都没能突破预训练语料的边界。这对做预训练和数据混合的人是个直接信号。没给更高分是因为这是研究论文而非产品发布,受众偏技术,但实验本身的说服力很强。

读原文 ↗导出 Markdown