# 预训练进步主要靠数据，模型架构改进更多是为了让更大规模训练跑得动

> 原标题：Pretraining progress is mostly coming from data

- 来源：Dwarkesh Patel 播客
- 发布时间：2026-09-08T16:10:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56439
- 原文：https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data

## 摘要

Dwarkesh Patel 和 Jerry Han 用 2019 到 2025 年每年公开的模型配方和数据语料，在 1e19 FLOPs 算力预算下做了对照实验。结果发现，数据改进带来的算力效率提升是 12 倍，模型改进只有 3.7 倍，两者效果基本可以叠加，不会互相干扰。数据侧从 2019 年 Reddit 高赞网页的 90 亿 token，进化到...

## 推荐理由

Dwarkesh 和 Jerry Han 用六年公开配方跑了一组对照实验，把预训练进步拆成数据 12 倍、模型 3.7 倍，结论清晰有数字。没给更高分是因为这是博客文章，不是同行评审论文，但实验设计和结论对从业者已经够用。

## 锐评

Dwarkesh Patel 和 Jerry Han 做了个很直观的对照实验：用每年公开的模型配方和数据语料，在固定算力预算下训练，看进步到底来自哪里。结果很明确——在 1e19 FLOPs 这个量级，数据改进贡献了 12 倍的算力效率提升，模型改进只有 3.7 倍。而且两者效果基本独立，可以叠加，不会互相干扰。

这个结论有个重要前提：实验规模不算大，用的是公开配方，不是前沿实验室的真实训练配置。正文也承认，小模型更受益于数据质量，大模型可能更看重数据量而非激进过滤，但这点在真正的前沿规模上还没验证。另外，评估用的是 OLMES 这套相对简单的多选题基准，不是预训练损失本身，所以结果里会带些噪声，虽然他们用多次随机种子尽量压了。

我会给这个 12 倍打个折——它说明数据工程的价值被低估了，但不能直接推导出“模型架构研究不重要”。作者自己也说，模型侧很多改进（比如混合专家、FlashAttention、稳定性修复）的主要价值是让更大规模训练成为可能，而不只是省算力。这点正文没展开量化，是个缺口。
