跳到正文
AI HOT 精选

LMSYS 发布 DFlash 投机解码,Qwen 3.5 397B 吞吐量提升 4.3 倍

下一代投机解码:DFlash 与 Spec V2

LMSYS 联合 Z Lab 和 Modal 推出了 DFlash 投机解码方案,搭配新的 Spec V2 引擎。DFlash 不用传统草稿模型一个词一个词地猜,而是用“块扩散”一次并行生成一整块候选词,更贴合 GPU 的胃口。它的核心技巧是 KV 注入:直接把目标大模型中间层的隐藏状态塞进草稿模型的 KV 缓存里,让草稿模型跳过理解全文的步骤,专心预...

推荐理由:LMSYS、Z Lab 和 Modal 联合放出了 DFlash + Spec V2,核心卖点是 KV 注入加块扩散并行草稿,推理加速有具体机制和代码落地。但这是纯底层推理优化,对非推理方向的读者吸引力有限,所以不推全站。

读原文 ↗导出 Markdown