# Orthrus-Qwen3-8B：冻住 Qwen3-8B 主干，加一个扩散注意力头，一次前向最多吐出 7.8 倍的 token，输出分布数学上可证明不变

> 原标题：Orthrus-Qwen3-8B : up to 7.8×tokens/forward on Qwen3-8B, frozen backbone, provably identical output distribution

- 来源：r/LocalLLaMA
- 发布时间：2026-05-15T19:07:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21475
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1te5xpu/orthrusqwen38b_up_to_78tokensforward_on_qwen38b/

## 摘要

这个工作把 Qwen3-8B 的原始参数完全冻住，只额外训练一个扩散注意力头，让模型一次前向能生成多个 token，最高做到 7.8 倍。在 MATH-500 上实测 wall-clock 速度大约快了 6 倍。训练只动了 16% 的参数，用了不到 10 亿 token 的数据，在 8 张 H200 上跑了 24 小时。论文声称输出分布和原模型在数学上...

## 推荐理由

我会先打个折：这是单篇 Reddit 研究发布，没有论文或第三方复现，验证强度偏弱。但信息量够用——在 Qwen3-8B 冻结主干上加扩散注意力头，只训 16% 参数，8 张 H200 跑一天，MATH-500 上 token 吞吐最高提到 7.8 倍，墙钟时间约快 6 倍，而且输出分布可证明不变。这点先别太激动，正文没披露其他 benchmark 和更长序列下的表现，但推理加速和一致性这两点对本地跑模型的从业者来说很实在，所以放在 featured 里当个信号看。

## 锐评

这条值得关注的点是“冻住原模型、不改输出分布”这个承诺。Orthrus 的做法是在 Qwen3-8B 外面套一个可训练的扩散注意力头，让模型一次前向生成多个 token，最高做到 7.8 倍，MATH-500 上实际 wall-clock 速度大约快了 6 倍。训练成本看着不高：只动了 16% 的参数，用了不到 10 亿 token 的数据，8 张 H200 上跑 24 小时。

不过有几个地方要先打个折。第一，正文因为 Reddit 屏蔽没拿到全文，论文声称的“输出分布数学上一致”具体怎么验证的、在哪些任务上成立，现在看不到细节。第二，MATH-500 是推理任务，这种多 token 预测在长文本生成、对话等场景下效果会不会打折扣，正文没披露。第三，7.8 倍是理论峰值，实际加速比受 batch size、序列长度影响很大，6 倍这个数是在什么设置下测的也需要看原文。

如果是真的，这个思路对本地部署挺友好：不用重新训底座，加一个小头就能大幅提推理速度。但还缺其他 benchmark 上的精度对比和延迟数据，光一个 MATH-500 不够下结论。
