# 英伟达放出 Nemotron-Labs-Diffusion 模型，用扩散解码把 8B 模型跑到 850 tok/s

> 原标题：Nemotron-Labs-Diffusion from NVIDIA

- 来源：r/LocalLLaMA
- 发布时间：2026-05-19T18:09:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23737
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1thv6du/nemotronlabsdiffusion_from_nvidia/

## 摘要

英伟达发了 Nemotron-Labs-Diffusion 系列，包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码，还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token，作为对比，同样条件下自回归解码是 253 tok...

## 推荐理由

NVIDIA 这次没走自回归老路，拿扩散模型做了三个稠密 LLM，最小的 3B，最大的 14B。我会先打个折：目前只有 Reddit 帖子当信源，没有论文或技术报告，所以 850 tok/s 这个数先别太激动，正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation，理论上可以一次出多个 token，不用像自回归那样一个字一个字往外蹦，推理延迟能压下去。8B 模型在 GB200 上跑出这个速度，如果属实，对本地跑模型、做实时对话的人挺省钱。信息缺口也明显：没提训练数据、没提多语言能力、没...

## 锐评

这条消息最值得看的是推理速度。8B模型在GB200上单并发跑到每秒850个token，对比传统自回归解码的253 tok/s，确实快了一大截。他们用的是一种叫扩散并行解码的方法，简单说就是让模型一次生成一整段文本，再逐步修正，而不是一个字一个字往外蹦。还加了个self-speculation技巧，相当于模型自己给自己做推测解码，进一步压榨速度。

但这里有几个信息缺口。正文没说明850 tok/s是在什么任务上测的，是简单对话还是长文生成，也没提输出质量有没有打折。扩散模型在图像生成里很成熟，搬到文本上最大的坑就是连贯性和事实准确性，这两点原文完全没提。另外，测试硬件是GB200，这是英伟达最新的高端卡，普通开发者手里的设备能不能复现这个速度，要打个大问号。

我会先观望。如果后续有独立评测验证精度没塌，这套方法对需要低延迟的场景确实有用。但眼下只能把它当成一个有意思的工程探索，别急着对标生产环境。
