# 预训练并行策略与翻车训练笔记

> 原标题：Notes on pretraining parallelisms and failed training runs.

- 来源：Dwarkesh Patel 播客
- 发布时间：2026-05-16T19:01:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22454
- 原文：https://www.dwarkesh.com/p/notes-on-pretraining-parallelisms

## 摘要

这篇笔记聊了两件事：预训练为什么容易跑崩，以及怎么把训练拆到多张 GPU 上。跑崩的核心原因有两个——破坏因果性和引入偏差。比如 MoE 路由里用专家选择（expert choice）分配 token，会让 token n 的去向依赖 token n+k 的路由结果，训练时看到了推理时看不到的信息；token 丢弃也会让后面的 token 影响前面的处...

## 推荐理由

Dwarkesh 这期笔记把预训练里容易翻车的地方摊开讲：expert choice 和 token dropping 会破坏因果性，FP16 集体通信能把一万次累加算偏，这些坑不踩过很难意识到。我会先打个折——它更像从业者之间的经验交换，不是系统性的技术报告，但给的数字（6ND、288GB、参数量×3）对算成本和排故障都有用。正文没展开具体实验验证，所以别当定量结论用。

## 锐评

这篇笔记把预训练翻车的坑讲得很实在。核心就两类：一是破坏因果性，比如 MoE 里用专家选择分配 token，会让 token n 的去向依赖后面 token n+k 的路由结果，训练时偷看了推理时拿不到的信息，传 Llama 4 表现不佳可能跟这有关；token 丢弃也有类似问题，后面 token 匹配度更高会导致前面 token 被忽略，Gemini 2 Pro 据说踩过这个坑。二是引入偏差，偏差不像方差能平均掉，会越滚越大。GPT-4 早期训练就栽在 FP16 集体通信上——FP16 在 1024 以上精度间隔变大，反复加 1 会被反复舍入回原值，累加结果能差 10 倍，这种 bug 极难排查。

文章还抛出一个有意思的问题：训练翻车的原因是不是就那么几种，修完就一劳永逸？聊的人觉得不是，规模每上一个台阶都会有新坑冒出来，光数值精度这一块就能花式翻车。另外他对 AI 自动写 CUDA kernel 短期不乐观，认为这更接近 AGI 完全体问题。

缺的东西也明显：全是经验之谈和传闻，没有实验数据或复现验证，Llama 4 和 Gemini 2 Pro 的案例都标注是 rumor 和 apparently。当成工程避坑清单看有用，但别当正式结论引用。
