跳到正文
r/LocalLLaMA

网友实测 Gemma 4 和 Qwen 3.6 的 MTP 加速:vLLM 上推理速度提升 3.34 倍

I tested MTP on vLLM and llama.cpp for Gemma 4 & Qwen 3.6 — 3.34x faster inference, here are my findings RTX 6000 PRO.

一位老哥在 RTX PRO 6000 显卡上跑了 MTP(多 token 预测,一次猜好几个词来加速生成)的测试。他用 vLLM 跑 Gemma 4 31B 模型,开了 MTP 后速度从每秒 39.69 个 token 飙到 132.52 个,快了 3.34 倍。测试是跑 10 次、每次生成 1500 个 token 取的结果。不过帖子没提生成质量有没...

推荐理由:这是一篇第一人称的硬核速度测试,有硬件型号、模型、框架和明确的 tok/s 对比,H/K/R 三点都踩中了。我会先打个折:来源是个人博客,权威性一般,而且质量、显存这些关键指标正文没披露,所以分数压在 featured 低位是合理的。

读原文 ↗导出 Markdown