# Scaling Law 五年三次修正：从“把模型做大”到“把模型做小”

> 原标题：Scaling Law 塌房了吗？三次修正的真实故事，和越来越小的模型

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-05T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42587
- 原文：https://yage.ai/share/scaling-law-three-acts-20260705.html

## 摘要

Scaling law 不是物理定律，是一条靠实验拟合出来的曲线，实验条件一变，结论就跟着变。2020 年 OpenAI 的 Kaplan 论文因为实验设置偏差，得出“优先堆参数”的结论，直接塑造了 GPT-3。2022 年 DeepMind 的 Chinchilla 修正了配比，发现每个参数配大约 20 个 token 才划算，小模型多喂数据反而更强...

## 推荐理由

这是一篇高质量的辟谣和科普。它没有复读“scaling law 失效”的惊悚标题，而是把 Kaplan、Chinchilla 和 LLaMA 三次修正串成一条线，用具体的实验偏差和数据配比说明为什么结论会变。我会先打个折：它属于评论和知识梳理，不是一手产品发布，但信息密度和纠正作用足够强。正文没披露某些最新模型的内部训练细节，但引用的公开论文和数据足以支撑它的判断。

## 锐评

这篇文章把五年里 scaling law 的三次修正讲清楚了，比那篇刷屏的“塌房”文靠谱得多。核心事实是：2020 年 OpenAI 的 Kaplan 论文因为漏算输出层、学习率设置不当等实验偏差，得出了“优先堆参数”的结论，直接催生了 GPT-3。2022 年 DeepMind 用更大规模实验纠正了配比，发现每个参数配大约 20 个 token 才划算，小模型多喂数据反而更强。2024 年两组独立复现研究确认，修正 Kaplan 的实验设置后，能几乎精确复现 Chinchilla 的结论，这不是骗局，是正常的科学校准。

更有意思的是第三幕：2023 年起，Meta 等公司开始故意偏离 Chinchilla 的 20:1 配比，给 80 亿参数的 Llama 3 喂了 15 万亿 token。原因不是数学错了，是题目变了——优化目标从单次训练成本，换成了训练加推理的总成本。小模型推理便宜，多花训练费换更小的模型，只要调用量够大就划算。清华的 Densing Law 量化了这个趋势：达到同等能力所需的参数量大约每 3.5 个月减半。

至于那篇刷屏文引用的“法语比英语高效 50 到 100 倍”，出处是一条当天发布的博客评论，没有同行评议，而唯一一篇正面比较的同行评议研究结论相反。这个细节足够给那篇文章的可信度定位了。信息缺口在于：文章没提 Densing Law 的具体实验条件和适用范围，也没展开讨论小模型的知识存储地板（每个参数约 2 bit）对实际产品形态的约束。
