# 谷歌开源扩散文本模型 DiffusionGemma，生成速度比自回归模型快 4 倍

> 原标题：Mythos阴影里谷歌悄悄发模型，速度暴涨4倍

- 来源：量子位 · 公众号
- 发布时间：2026-06-11T04:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37751
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247896929&idx=2&sn=588705bddb905f19a9792a684f13b53a

## 摘要

谷歌把生成图片的扩散模型思路搬到了文字生成上，开源了 DiffusionGemma。它不像传统模型那样一个字一个字往外蹦，而是一次铺开 256 个 token 的“画布”，从噪声开始多轮去噪，整段文字同时浮现。在 H100 上跑到每秒 1000+ token，消费级 RTX 5090 上也有 700+，比同规格自回归模型快了约 4 倍。这个 26B 参...

## 推荐理由

谷歌悄悄开源 DiffusionGemma，把扩散模型那套一次去噪整段文字的路子用在文本生成上，速度数字很漂亮，比同类模型快约 4 倍。我会先打个折——目前只有速度数据，生成质量、实际任务表现都没披露，这点先别太激动。分数没更高就是因为缺这些关键验证。

## 锐评

这条新闻最值得看的是思路切换：传统语言模型像打字机，一个字一个字往外蹦；DiffusionGemma 像印刷机，先铺满一页噪声，再一轮轮去噪，整段文字同时浮现。26B 参数的 MoE 架构，推理时只激活 3.8B，量化后 18GB 显存就能跑，消费级 RTX 5090 上也有 700+ token/s。

速度数字确实亮眼，但质量差距不能忽略。谷歌自己把它定位成“实验性快马”，适合对延迟敏感、本地跑的场景，不是来替代 Gemma 4 的。双向注意力让模型能实时自我修正，微调后数独准确率从 0% 跳到 80%，说明在某些结构化任务上有奇效，但通用能力还没验证。

正文没披露具体评测基准和对比细节，Apache 2.0 开源、权重已上 Hugging Face 是加分项。如果是真的，这个速度对实时对话、本地代码补全挺省钱，但别急着把现有管线换掉——先看社区跑出来的实际效果再说。
