# DiffusionGemma 技术报告：用离散扩散一次生成 256 个 token，单卡跑到每秒 1500 token

> 原标题：DiffusionGemma Technical Report

- 来源：Hacker News 首页
- 发布时间：2026-08-20T13:24:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51828
- 原文：https://arxiv.org/abs/2608.00146

## 摘要

Google 放出了一个实验性的开源模型 DiffusionGemma，它不按传统方式一个字一个字往外蹦，而是每次并行处理并逐步修正一个 256 个 token 的文本块。这带来一个直接好处：在单张 H100 上实测生成速度能达到每秒约 1500 个 token，比用了投机解码的常规自回归模型还快。模型本身不是从头训练的，而是拿 MoE 架构的 Gem...

## 推荐理由

DiffusionGemma 把扩散模型用到文本生成上，一次并行处理 256 个 token 再逐步修正，单卡 H100 跑到约 1500 tok/s，比投机解码还快。没给更高分是因为目前只是技术报告，没有产品落地路径，也没真实部署数据，速度数字我会先打个折看后续验证。

## 锐评

这条技术报告最值得看的是速度。DiffusionGemma 不按传统自回归模型那样一个字一个字往外蹦，而是每次并行处理并逐步修正一个 256 个 token 的文本块，在单张 H100 上实测跑到每秒约 1500 个 token，比用了投机解码的常规模型还快。模型不是从头训练的，而是拿 MoE 架构的 Gemma 4（激活参数 3.8B，总参数 25.2B）做微调，整个训练只用了原始模型不到 10% 的训练 token 预算，分两步走：先做监督微调让模型学会双向去噪，再用强化学习加采样器蒸馏来同时提质量和推理效率。

我会先打个折：速度数字很漂亮，但这是实验性开源模型，论文没披露它在复杂推理或长文本任务上的具体退化程度，只说自回归解码时会有轻微质量下降。另外，并行生成 256 个 token 的块，在实际应用里怎么处理不同长度的输出、怎么保证连贯性，这些细节正文也没展开。如果是真的省钱又好用，后续得看社区实测和更多消融实验。
