# Domino：把推测解码里的因果建模和自回归起草拆开，Qwen3 吞吐最高提 5.8 倍

> 原标题：Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding

- 来源：r/LocalLLaMA
- 发布时间：2026-06-06T12:16:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34872
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tyfqmp/domino_decoupling_causal_modeling_from/

## 摘要

这篇论文提出 Domino，把推测解码（让一个小模型先快速起草、大模型再校验）里的两个步骤拆得更干净：因果建模和自回归起草不再绑在一起跑。在 Qwen3 上测出了最高 5.8 倍的吞吐提升。不过 Reddit 帖子本身被屏蔽了，正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节，所以这个 5.8 倍是在什么条件下跑出来的还不清楚，先打...

## 推荐理由

这篇的核心卖点是 5.8 倍吞吐提升，但 Reddit 帖子被屏蔽了，正文没写用什么硬件、基线怎么设、数据集和接受率这些关键信息，所以这个数字是在什么条件下跑出来的还不清楚，先打个折。不过思路本身有意思：把起草和校验拆干净，代码和模型也开源了，对搞推理优化的人值得看一眼。

## 锐评

Domino 的思路是把推测解码里“起草”和“校验”两个步骤拆开，不让小模型一边理解上下文一边生成草稿，而是把因果建模单独拎出来，这样起草可以跑得更快。论文在 Qwen3 上测出了最高 5.8 倍的吞吐提升，代码和模型权重也放出来了。

但 Reddit 原帖被屏蔽，正文没披露具体用了什么硬件、基线怎么设的、数据集和接受率这些关键细节。5.8 倍是在什么条件下跑出来的还不清楚——如果是在高并发、长序列或者特定硬件上测的，实际到手可能没那么高。另外，拆开因果建模和自回归起草之后，草稿质量会不会下降、接受率会不会掉，这些都没说。

如果是真的，这个方案对本地部署和推理服务都挺省钱，但得等有人复现了再看。
