# 网友实测 Gemma 4 和 Qwen 3.6 的 MTP 加速：vLLM 上推理速度提升 3.34 倍

> 原标题：I tested MTP on vLLM and llama.cpp for Gemma 4 &amp; Qwen 3.6 — 3.34x faster inference, here are my findings RTX 6000 PRO.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-29T20:42:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30445
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1trf0r0/i_tested_mtp_on_vllm_and_llamacpp_for_gemma_4/

## 摘要

一位老哥在 RTX PRO 6000 显卡上跑了 MTP（多 token 预测，一次猜好几个词来加速生成）的测试。他用 vLLM 跑 Gemma 4 31B 模型，开了 MTP 后速度从每秒 39.69 个 token 飙到 132.52 个，快了 3.34 倍。测试是跑 10 次、每次生成 1500 个 token 取的结果。不过帖子没提生成质量有没...

## 推荐理由

这是一篇第一人称的硬核速度测试，有硬件型号、模型、框架和明确的 tok/s 对比，H/K/R 三点都踩中了。我会先打个折：来源是个人博客，权威性一般，而且质量、显存这些关键指标正文没披露，所以分数压在 featured 低位是合理的。

## 锐评

这条帖子最值钱的就是那个 3.34 倍的提速数字。测试环境是 RTX PRO 6000 这张 Blackwell 架构的新卡，用 vLLM 跑 Gemma 4 31B，开了 MTP（多 token 预测，一次猜好几个词来加速生成）后，每秒能吐 132.52 个 token，不开只有 39.69。测试跑了 10 次、每次生成 1500 个 token，样本量不算大但够看个趋势。

不过得打几个折。第一，正文没披露生成质量有没有下降，MTP 猜错词的时候可能会让输出变味，这点他没测。第二，没提显存占用变化，开 MTP 通常要多占显存，对本地跑大模型的人来说这点很关键。第三，帖子只测了 Gemma 4，Qwen 3.6 的数据没放出来，标题里写了但内容缺失。另外原帖被 Reddit 的网络安全拦了，我们只能看到摘要，具体配置和参数细节拿不到。

如果你也在本地跑大模型，这个提速幅度值得跟，但先别急着切生产——等有人补上质量对比和显存数据再说。
