# LMSYS 发布 DFlash 投机解码，Qwen 3.5 397B 吞吐量提升 4.3 倍

> 原标题：下一代投机解码：DFlash 与 Spec V2

- 来源：AI HOT 精选
- 发布时间：2026-06-15T17:25:17.048Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38450
- 原文：https://www.lmsys.org/blog/2026-06-15-next-generation-speculative-decoding-dflash-v2

## 摘要

LMSYS 联合 Z Lab 和 Modal 推出了 DFlash 投机解码方案，搭配新的 Spec V2 引擎。DFlash 不用传统草稿模型一个词一个词地猜，而是用“块扩散”一次并行生成一整块候选词，更贴合 GPU 的胃口。它的核心技巧是 KV 注入：直接把目标大模型中间层的隐藏状态塞进草稿模型的 KV 缓存里，让草稿模型跳过理解全文的步骤，专心预...

## 推荐理由

LMSYS、Z Lab 和 Modal 联合放出了 DFlash + Spec V2，核心卖点是 KV 注入加块扩散并行草稿，推理加速有具体机制和代码落地。但这是纯底层推理优化，对非推理方向的读者吸引力有限，所以不推全站。

## 锐评

这条新闻的核心是把大模型推理的“投机解码”又往前推了一步。传统做法是让一个小模型（草稿模型）一个字一个字地猜，大模型再批量验证。DFlash 的思路变了：它让草稿模型一次并行生成一整块候选词（比如 16 个），更符合 GPU 并行计算的胃口。更巧的是“KV 注入”——直接把大模型中间层的理解结果塞进草稿模型的缓存里，省掉了草稿模型重新理解全文的步骤，让它专心猜下一块词。

在 HumanEval 编程测试上，搭配 Qwen 3.5 397B 模型，DFlash 的吞吐量是原版模型的 4.3 倍，比模型自带的 MTP 投机方式还快 1.5 倍。这个数字是在 8 张 B200 显卡上跑出来的，并发数设为 1，属于低负载场景的极限测试。

不过正文没提这种加速在更高并发、更长对话或非代码任务上的表现会打多少折扣。草稿模型的接受率（大模型最终采纳了多少它猜的词）也没给具体分布，只说了平均接受长度。另外，KV 注入对模型中间层选择的敏感性、以及训练草稿模型用了多少数据，这些细节都缺。如果要在自己的业务里复现，这点先别太激动，得自己测一下实际场景的接受率和延迟波动。
