# AMD 论文发现 FP4 训练不稳，锅不在随机性不够

> 原标题：AMD新论文颠覆认知：FP4训练不稳定，原因不是随机性不足

- 来源：机器之心 · 公众号
- 发布时间：2026-05-27T03:56:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28887
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651035341&idx=2&sn=60922570204a163ed48f2515c8e3ef97

## 摘要

AMD 和宾州州立大学用 MI355X 原生 FP4 硬件预训练了 Llama 3.1-8B，端到端速度比 FP8 基线快了 9-10%。但论文指出，Wgrad（权重梯度）量化是拖后腿的环节，导致每个 token 的计算开销额外增加 26-27%，而且用确定性 Hadamard 方法也稳不住。正文没披露最终模型的验证集效果对比，这点先别太激动。

## 推荐理由

我会先打个折：这是一篇偏训练基础设施的研究，不是通用大模型发布，所以分数不会给到顶。但它的钩子很锋利——直接挑战“FP4 不稳定是因为随机性不足”这个流行说法，并且给出了在 AMD 最新硬件上跑 Llama 3.1-8B 的实测数据。速度提升 9-10% 是实打实的，但 Wgrad 带来的 26-27% 额外开销也说明这条路还没完全走通，这点先别太激动。对关心训练成本和硬件选型的从业者来说，这篇值得一看。

## 锐评

这篇论文最值得看的地方，是它直接点出了FP4训练真正的拖后腿环节：权重梯度（Wgrad）量化。AMD和宾州州立用MI355X原生FP4硬件预训练Llama 3.1-8B，端到端速度只比FP8基线快了9-10%，远没到理论翻倍的预期。原因在于Wgrad量化让每个token的计算开销额外增加了26-27%，把省下来的时间又吃回去不少。

团队还试了确定性Hadamard变换来稳定训练，结果没稳住。这说明FP4训练的不稳定，根子不在随机性不足，而是量化误差本身在梯度回传时被放大了。不过正文没披露最终模型的验证集效果对比，也没给出FP8和FP4在同等算力下的loss曲线，所以这9-10%的提速到底换来了多少精度损失，目前还是笔糊涂账。

另外，实验只在一款硬件上跑了一个模型尺寸，换其他架构或更大模型是否成立，也还没验证。
