跳到正文
r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Gemma 4 MTP released

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

读原文 ↗导出 Markdown