# MTP 实测：写代码能加速 71%，写小说反而变慢 9%，任务类型决定投机推理是帮忙还是帮倒忙

> 原标题：MTP benchmark results: the nature of the generative task dictates whether you will benefit (coding) or get slower inference (creative) from speculative inference. No other factor comes close.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-10T19:25:50.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16844
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t9gcar/mtp_benchmark_results_the_nature_of_the/

## 摘要

一位 Reddit 用户用 Qwen 3.6 27B 的 MTP 量化模型跑了 300 多次测试，发现投机推理（让模型先猜后验证）的效果完全看任务类型。写代码时草稿被采纳的比例高达 79% 到 89%，用 F16 精度跑代码生成速度提升了 171%；但换成创意写作，Q4_K_M 量化下推理速度反而慢了 9%。结论很直接：别只看模型和量化，先看你要让模型...

## 推荐理由

我会先打个折：这只是 Reddit 上一个用户的单次实验，不是官方基准，但 300 多次测试把投机推理的任务依赖性讲得很清楚。编码任务接受率高、加速明显，创意写作接受率低、反而变慢，这个结论对本地跑模型的开发者有直接参考价值。正文没披露测试硬件和具体 prompt，但数据量够大，可以先信一半。

## 锐评

这条测试把投机推理的适用边界讲得很清楚。Reddit 用户用 Qwen 3.6 27B 的 MTP 量化版跑了 300 多次，结论是任务类型决定一切，模型和量化精度反而是次要的。写代码时，模型先猜后验证的草稿被采纳的比例高达 79% 到 89%，用 F16 精度跑代码生成速度直接提升了 171%。但换成创意写作，Q4_K_M 量化下推理速度反而慢了 9%。

我会先打个折：这是单用户、单模型的测试，正文没披露测试用的具体 prompt 和硬件配置，样本量也不算大。不过方向是对的——代码有固定语法和模式，模型猜得准；创意写作发散性强，猜错就得回头重算，反而增加开销。

还缺什么？不同模型架构（比如非 MTP 的投机解码方案）的对比，以及更长文本、混合任务下的表现。这点先别太激动，但如果你主要用本地模型写代码，这个 171% 的提速值得在自己的环境里复现一下。
