# 谷歌开源 26B 文本扩散 MoE 模型 DiffusionGemma，推理时只激活 3.8B 参数，一次生成 256 个 token

> 原标题：谷歌开源26B文本扩散MoE，劈柴：生成速度像赛马一样快

- 来源：机器之心 · 公众号
- 发布时间：2026-06-11T04:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37748
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651038459&idx=2&sn=2f131b7dd31fb1cdacbf16bcb3f312a7

## 摘要

谷歌发了一个实验性的开源模型 DiffusionGemma，用的是 Apache 2.0 协议。它不走自回归模型逐 token 生成的路线，而是一次性起草 256 个 token 的文本块，把解码瓶颈从内存带宽转向了计算本身。在单张 H100 上能跑到每秒 1000+ token，比自回归模型快最多 4 倍。模型总规模 26B，但推理时只激活 3.8B...

## 推荐理由

谷歌开源了一个 26B 的文本扩散模型，跳过自回归解码，推理只激活 3.8B 参数，单张 H100 跑到每秒 1000+ token。Apache 2.0 协议，有具体的速度对比和机制说明，对做推理优化的人有直接参考价值。不是公关稿，数字和做法都给了，值得放进精选。

## 锐评

谷歌这次放出的DiffusionGemma是个实验品，核心卖点是快。它不像传统模型一个字一个字往外蹦，而是一次性起草256个token的文本块，把速度瓶颈从内存带宽转移到了计算上。在单张H100上能跑到每秒1000多个token，比自回归模型快最多4倍。模型总规模26B，但推理时只激活3.8B参数，量化后能在18GB显存的消费级显卡上跑，Apache 2.0协议开源。

不过快是有代价的。谷歌自己承认输出质量不如标准版Gemma 4，生产环境还是推荐用自回归版本。这模型更适合对延迟敏感的非线性任务，比如行内编辑、代码补全这类场景。正文没披露具体评测基准和分数差距，也没说在哪些任务上质量掉得最厉害。

这点先别太激动。文本扩散路线还在早期，26B只激活3.8B的MoE架构听起来省资源，但实际效果要看后续社区实测。如果你只是想尝鲜跑个快模型，可以试试；如果要上业务，等第三方横评出来再说。
