# MTPLX 让苹果芯片跑大模型快了一倍多，原生 MTP 推理引擎来了

> 原标题：MTPLX | 2.24x faster TPS | The native MTP inference engine for Apple Silicon

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T00:31:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13680
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t3zuvy/mtplx_224x_faster_tps_the_native_mtp_inference/

## 摘要

一个叫 MTPLX 的推理引擎在 MacBook Pro M5 Max 上把 Qwen3.6-27B 的生成速度从每秒 28 个 token 提到了 63 个 token，快了 2.24 倍。测试用的是 4-bit MLX 量化，温度 0.6，top_p 0.95，top_k 20，最佳推测深度 D3。关键点是它直接用了模型自带的 MTP 头做推测解码...

## 推荐理由

我会先打个折：目前只有 Reddit 单帖来源，测试范围也限定在 Apple Silicon，验证面还窄。但 2.24 倍的吞吐提升是实打实的数字，而且 MTP heads 内置在模型里，不用额外加载一个 drafter 模型占内存，这点对 Mac 用户确实挺省钱。正文没披露更多模型或硬件的对比数据，所以先放在 featured 低位，等有更广的复现再往上调。

## 锐评

这条消息最值得看的是实现路径：MTPLX 没走传统推测解码的老路——再挂一个小模型当“草稿”，而是直接调用 Qwen3.6 自带的 MTP 头来预测后续 token。好处很直接，省掉第二个模型的内存占用，在统一内存架构的 Mac 上尤其划算。测试机是 M5 Max，4-bit MLX 量化，温度 0.6，top_p 0.95，top_k 20，最佳推测深度 D3 下速度从 28 tok/s 翻到 63 tok/s，2.24 倍提升。

不过正文被 Reddit 的网络安全拦截了，我没看到完整的技术细节和代码仓库。几个关键信息缺失：MTP 头的接受率是多少，不同深度下的延迟抖动大不大，换成其他支持 MTP 的模型表现是否一致。另外测试只跑了 27B 这个尺寸，小模型或更大尺寸的收益曲线还不清楚。如果接受率偏低，实际加速会打折扣，这点先别太激动。建议等代码公开后看社区复现结果，尤其是非 Qwen 系列模型的适配难度。
