# DFlash 2 让并行猜词更聪明：每次验证多出 20% 以上有效输出，延迟只增加约 1%

> 原标题：DFlash 2: Keep Drafting Parallel

- 来源：Hacker News 首页
- 发布时间：2026-08-19T20:28:43.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51680
- 原文：https://inco.ai/blog/dflash2/

## 摘要

Inco AI 发布了 DFlash 2，在原来一次性并行猜出整段候选词的基础上，加了一个轻量的路径选择器。DFlash 原本是每个位置独立挑最可能的词，但词与词之间可能不连贯，导致验证时整段被砍掉。DFlash 2 的做法是每个位置保留前 16 个候选，然后给相邻词对打分，从中挑出一条最连贯的路径。在 Qwen3.8-27B 上实测，每次验证通过的有...

## 推荐理由

DFlash 2 是对已有推理加速方法的明确改进，有实测数据，不是空谈。分数没给更高是因为这只是一篇技术博客，不是模型发布或产品上线，影响面集中在推理栈圈子。

## 锐评

DFlash 2 解决的是并行猜词的一个老毛病：每个位置独立挑最可能的词，结果连起来不像人话，验证时整段被砍。新做法是每个位置保留前 16 个候选，再给相邻词对打分，挑出一条最连贯的路径。在 Qwen3.8-27B 上实测，每次验证通过的平均词数从 4.27 涨到 6.79，吞吐量达到常规解码的 2.7 到 3.4 倍。

这个提升很实在，因为代价极低——只增加约 1% 的周期延迟，输出质量不变。文章说主流推理框架都已支持，Hugging Face 上 DFlash 模型下载量超过 350 万次，生态铺得挺开。

不过要注意，这些数字是在 batch size 为 1 时测的，高并发下的表现正文没给。另外，路径选择器本身的计算开销虽然小，但在不同模型和硬件上的泛化效果还需要更多第三方验证。
