Domino:把推测解码里的因果建模和自回归起草拆开,Qwen3 吞吐最高提 5.8 倍
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
这篇论文提出 Domino,把推测解码(让一个小模型先快速起草、大模型再校验)里的两个步骤拆得更干净:因果建模和自回归起草不再绑在一起跑。在 Qwen3 上测出了最高 5.8 倍的吞吐提升。不过 Reddit 帖子本身被屏蔽了,正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节,所以这个 5.8 倍是在什么条件下跑出来的还不清楚,先打...
推荐理由:这篇的核心卖点是 5.8 倍吞吐提升,但 Reddit 帖子被屏蔽了,正文没写用什么硬件、基线怎么设、数据集和接受率这些关键信息,所以这个数字是在什么条件下跑出来的还不清楚,先打个折。不过思路本身有意思:把起草和校验拆干净,代码和模型也开源了,对搞推理优化的人值得看一眼。