# llama.cpp 合并 MTP 投机解码，Qwen3.6 27B 在 Strix Halo 上跑到 2.44 倍速

> 原标题：llama.cpp MTP support landed - Qwen3.6 27B at 2.44× on a Strix Halo, 2.17× on a RTX 3090 rig

- 来源：r/LocalLLaMA
- 发布时间：2026-05-18T19:01:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22539
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tgxau6/llamacpp_mtp_support_landed_qwen36_27b_at_244_on/

## 摘要

llama.cpp 在 PR #22673 里正式合并了 MTP（多 token 预测）投机解码支持。实测 Qwen3.6 27B 用 Q8_0 量化，在 Strix Halo 上从 7.4 tok/s 提到 18.1 tok/s，速度翻了 2.44 倍；双 RTX 3090 的 Q8_0 方案也从 25.7 tok/s 涨到 55.9 tok/s，约...

## 推荐理由

HKR 三项都满足：llama.cpp 合入了 MTP 投机解码，用 Qwen3.6 27B 在 Strix Halo 和 RTX 3090 上跑出了实打实的加速数字。范围限定在本地推理优化，不是大模型发布，78 分放在 featured 合适。

## 锐评

这条更新对玩本地模型的人是个实打实的好消息。llama.cpp 刚把 MTP（多 token 预测）投机解码合进主分支，实测 Qwen3.6 27B 用 Q8_0 量化，在 AMD Strix Halo 上从每秒 7.4 个 token 提到 18.1，速度翻了 2.44 倍；双 RTX 3090 的方案也从 25.7 涨到 55.9，约 2.17 倍。数字说明两件事：一是 MTP 在消费级硬件上确实能榨出不少性能，二是不同平台收益有差，Strix Halo 提升更明显，可能跟内存带宽或架构适配有关。

不过得打个折。帖子本身被 Reddit 的网络安全拦了，我拿不到原帖细节，比如测试用的上下文长度、batch size、功耗变化、输出质量有没有波动，这些正文都没披露。MTP 投机解码的原理是让模型一次猜多个后续 token 再验证，猜对了就省时间，猜错了得回退，所以实际加速比会随任务类型和采样参数浮动。另外 Qwen3.6 27B 本身对 MTP 的支持程度、llama.cpp 的实现有没有额外精度折损，目前也看不到验证。

如果你手头有 Strix Halo 或 3090 双卡，这个更新值得拉下来跑跑看，但别指望所有模型都能翻倍。还缺的是更多模型和硬件的横向对比，以及长文本、低并发场景下的稳定性数据。
