MTP 投机解码实测:助手模型没选对,速度可能白给
Not All MTP Assistants Are Created Equal
一位用户在 llama.cpp 里给 Gemma 4 Heretic 系列模型跑 MTP 投机解码,发现助手模型(draft model)选得好不好,直接决定加速效果是翻倍还是几乎没变化。他拿 26B Q8 模型测试,生成速度从每秒 30 个 token 跳到 62 个;12B Q4 模型更夸张,从 12 涨到 54。但同名 GGUF 文件不一定是同一...
推荐理由:我会先打个折:这是单篇 Reddit 帖子,没有其他来源交叉验证,而且 Gemma 4 的用户群比 Llama/DeepSeek 小。但优点也很明显——有硬核的实测数字,26B Q8 从 30 涨到 62 tok/s,12B Q4 从 12 涨到 54,结论直接可操作。对跑本地模型的人来说,这种“选对助手模型速度翻倍”的信息比泛泛的优化建议有用得多,所以给到 featured。