# Google 开源 DiffusionGemma：把 Gemma 4 改成扩散模型，解码飙到 1456 tok/s，但复杂推理掉分明显

> 原标题：Google 发布 DiffusionGemma：当语言模型不再只能从左到右写

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-16T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51126
- 原文：https://yage.ai/share/diffusiongemma-text-diffusion-20260816.html

## 摘要

Google 把训练好的 Gemma 4 26B-A4B 模型权重直接转成了离散多项式扩散模型，并在 Hugging Face 上开源。它不再从左到右逐个 token 写，而是在 256 个 token 的“画布”里通过多轮去噪并行生成。在单张 H100、FP8、单请求的纯解码测试中，速度达到每秒 1456 个 token，是原自回归模型的 7 倍多，...

## 推荐理由

Google 把训好的 Gemma 4 权重直接转成扩散模型开源了，不是从头训的，这点挺特别。它不再一个字一个字往外蹦，而是在 256 个 token 的“画布”里并行去噪生成，单张 H100 上纯解码跑到每秒 1456 个 token，是原版自回归模型的 7 倍多。代价是数学能力掉了一截，AIME 从 88.3 降到 69.1，正文没细说其他 benchmark 的跌幅，但至少给了推理工程师一个能算账的参考点。我会先打个折：这还只是单请求、FP8 的测试，真实并发和长文本下的表现还没看到，别急着下结论说扩散模型要替代自回归。

## 锐评

这条新闻最值得看的是“用成熟模型直接改生成方式”这条技术路线，终于有了一个完全开源、能直接部署的成品。DiffusionGemma 没从零训练，而是把现成的 Gemma 4 权重，通过离散扩散算法改造成了一个能在 256 个 token 的“草稿区”里反复修改的模型。这就像把一个人从只能顺着往下写的打字员，变成了可以先打草稿再局部润色的编辑。

速度提升很直接：在单张 H100、单请求、FP8 的纯解码测试里，它跑到每秒 1456 个 token，是原版自回归模型的 7 倍多。原理不复杂，它一次前向能同时处理 256 个候选 token，大幅减少了低并发下反复读取显存的带宽浪费。但代价也写在纸面上：AIME 数学推理从 88.3 分掉到 69.1 分，长上下文任务 MRCR 也从 44.1 降到 32.0。好消息是，模型切回自回归模式后分数能恢复到 84.2，说明底子没坏，是扩散生成这个动作本身导致了部分能力损失。

有几个关键信息报告没给：追加训练具体烧了多少算力和绝对 token 数，只说用了不到原训练预算的 10%。另外，首 token 延迟从 53 毫秒涨到 489 毫秒，在高并发下自回归的总吞吐量还会反超。所以这个模型目前最适合低并发、对延迟不那么敏感、但需要高吞吐生成的任务。
