# MTP 投机解码实测：助手模型没选对，速度可能白给

> 原标题：Not All MTP Assistants Are Created Equal

- 来源：r/LocalLLaMA
- 发布时间：2026-06-12T10:14:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37839
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u3r8ak/not_all_mtp_assistants_are_created_equal/

## 摘要

一位用户在 llama.cpp 里给 Gemma 4 Heretic 系列模型跑 MTP 投机解码，发现助手模型（draft model）选得好不好，直接决定加速效果是翻倍还是几乎没变化。他拿 26B Q8 模型测试，生成速度从每秒 30 个 token 跳到 62 个；12B Q4 模型更夸张，从 12 涨到 54。但同名 GGUF 文件不一定是同一...

## 推荐理由

我会先打个折：这是单篇 Reddit 帖子，没有其他来源交叉验证，而且 Gemma 4 的用户群比 Llama/DeepSeek 小。但优点也很明显——有硬核的实测数字，26B Q8 从 30 涨到 62 tok/s，12B Q4 从 12 涨到 54，结论直接可操作。对跑本地模型的人来说，这种“选对助手模型速度翻倍”的信息比泛泛的优化建议有用得多，所以给到 featured。

## 锐评

这条帖子来自 llama.cpp 社区的实际测试，结论很直接：MTP 投机解码不是无脑开就能加速，助手模型（draft model）的匹配度才是关键。测试者用 Gemma 4 Heretic 系列跑，26B Q8 模型从每秒 30 token 跳到 62，12B Q4 更夸张，从 12 涨到 54——但前提是助手模型选对了。

两个值得注意的发现：第一，同名 GGUF 文件不一定是同一个模型，这会导致加速效果天差地别；第二，未量化的助手模型比 Q4/Q8 版本稳定快大约 10 token/秒。另外，draft count 设为 1 反而效果最好，这点和直觉不太一样。

正文没披露测试用的具体 prompt 和硬件配置，所以这些数字只能当参考，不能直接套到自己的场景。如果你也在折腾 MTP，建议先检查日志确认 MTP 真的初始化成功了——作者特别提醒，很多人其实是在裸跑主模型，根本没用到投机解码。
