预训练进步主要靠数据,模型架构改进更多是为了让更大规模训练跑得动
Pretraining progress is mostly coming from data
Dwarkesh Patel 和 Jerry Han 用 2019 到 2025 年每年公开的模型配方和数据语料,在 1e19 FLOPs 算力预算下做了对照实验。结果发现,数据改进带来的算力效率提升是 12 倍,模型改进只有 3.7 倍,两者效果基本可以叠加,不会互相干扰。数据侧从 2019 年 Reddit 高赞网页的 90 亿 token,进化到...
推荐理由:Dwarkesh 和 Jerry Han 用六年公开配方跑了一组对照实验,把预训练进步拆成数据 12 倍、模型 3.7 倍,结论清晰有数字。没给更高分是因为这是博客文章,不是同行评审论文,但实验设计和结论对从业者已经够用。