英伟达放出 Nemotron-Labs-Diffusion 模型,用扩散解码把 8B 模型跑到 850 tok/s
Nemotron-Labs-Diffusion from NVIDIA
英伟达发了 Nemotron-Labs-Diffusion 系列,包含 3B、8B 和 14B 三个稠密模型。这组模型同时支持传统的自回归解码和新的扩散并行解码,还带了一种叫 self-speculation 的加速技巧。最抓眼球的是 8B 版本在 GB200 上单并发能跑到每秒 850 个 token,作为对比,同样条件下自回归解码是 253 tok...
推荐理由:NVIDIA 这次没走自回归老路,拿扩散模型做了三个稠密 LLM,最小的 3B,最大的 14B。我会先打个折:目前只有 Reddit 帖子当信源,没有论文或技术报告,所以 850 tok/s 这个数先别太激动,正文没披露具体测试条件和 batch size。但方向本身有意思——扩散并行解码加上 self-speculation,理论上可以一次出多个 token,不用像自回归那样一个字一个字往外蹦,推理延迟能压下去。8B 模型在 GB200 上跑出这个速度,如果属实,对本地跑模型、做实时对话的人挺省钱。信息缺口也明显:没提训练数据、没提多语言能力、没...