# NVIDIA 把自回归、扩散和自我推测解码塞进同一个模型：Nemotron-Labs-Diffusion

> 原标题：Nemotron-Labs-Diffusion：统一自回归、扩散与自我推测解码的三模式语言模型

- 来源：AI HOT 精选
- 发布时间：2026-07-07T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43008
- 原文：https://arxiv.org/abs/2607.05722

## 摘要

NVIDIA 这篇论文放出了一个叫 Nemotron-Labs-Diffusion 的模型，一个模型里集成了三种生成方式：逐 token 预测（自回归）、一次性去噪生成整段（扩散），以及让扩散先打草稿、自回归再校验的“自我推测”模式。训练时用了自回归和扩散的联合目标，扩散负责往前多看几步做规划，自回归提供从左到右的语言先验，两者互补。自我推测模式下，扩...

## 推荐理由

NVIDIA 把自回归、扩散和自我推测打包进一个模型，架构想法有新意，联合训练那部分写得也实在。但这就是篇论文，没产品也没场景，对一线干活的人触动不大，刚好卡在 featured 门槛上。

## 锐评

这篇论文放出了一个叫 Nemotron-Labs-Diffusion 的模型，最大卖点是把自回归、扩散和“自我推测解码”三种模式做进了同一个架构里。你可以把它理解成：平时用自回归逐字写，需要快的时候让扩散一次性生成整段草稿，再由自回归校验，相当于自己给自己当校对。训练时两个目标一起上，扩散负责往前多看几步做规划，自回归提供从左到右的语言习惯，两者互补。

数字上，8B 版本一次前向传播能解码的 token 数是 Qwen3-8B 的 6 倍，在 GB200 GPU 上用 SGLang 跑 SPEED-Bench 吞吐量高出 4 倍，精度还差不多。论文还做了一个“光速分析”，说在理想采样器下扩散比自我推测模式还能再多出 76.5% 的 token 产出，说明天花板还没到。模型覆盖 3B、8B、14B 三个尺寸，有基础版、指令版和视觉语言版。

不过这篇是纯论文，正文没披露任何开源权重计划或发布时间线。所有性能数据都来自论文自报，没有第三方复现验证。如果是真的，这个吞吐提升挺省钱，但在看到实际跑分和开放模型之前，我会先打个折。
