# Gemma 4 出了 MTP 草稿模型，解码速度翻倍但输出质量不变

> 原标题：Gemma 4 MTP released

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T16:01:17.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14428
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t4jq6h/gemma_4_mtp_released/

## 摘要

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token，再由主模型并行验证，相当于让模型“先猜后验”，最终解码速度能提一倍，而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了，正文没披露具体模型尺寸、硬件要求或实测延迟数据。

## 推荐理由

H、K、R 都站得住：钩子是 2 倍低延迟解码，有检查点和机制说明，不是画饼。它不是旗舰模型发布，属于实用更新，75 分放在 featured 低位合理。

## 锐评

Google 在 Hugging Face 放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token，再由主模型并行验证，相当于让模型“先猜后验”。官方说法是最终解码速度能提一倍，而且输出质量跟原来一模一样——这点先别太激动，因为 Reddit 原帖被网络策略挡了，正文没披露具体模型尺寸、硬件要求或实测延迟数据。

对本地部署的人来说，速度翻倍听着很香，但缺了关键信息：草稿模型多大、显存多占多少、在什么卡上测的、batch size 是多少。这些不补上，没法判断是实验室理想值还是实际能用的。另外，MTP 这种投机解码方案对长文本生成效果更好，短对话场景收益会打折。建议等社区有人跑出实测数据再动手。
