# Qwen 3.6 27B 用上 MTP 后推理速度提升 2.5 倍，48GB 显存可跑 26 万上下文

> 原标题：2.5x faster inference with Qwen 3.6 27B using MTP - Finally a viable option for local agentic coding - 262k context on 48GB - Fixed chat template - Drop-in OpenAI and Anthropic API endpoints

- 来源：r/LocalLLaMA
- 发布时间：2026-05-06T09:35:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14962
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t57xuu/25x_faster_inference_with_qwen_36_27b_using_mtp/

## 摘要

这篇帖子来自 Reddit 的 r/LocalLLaMA，作者分享了一个 llama.cpp 的 PR，为 Qwen 3.6 27B 模型添加了 MTP（多令牌预测）支持，实测推理速度提升了 2.5 倍。在 Mac M2 Max 96GB 上达到了 28 tok/s 的生成速度。关键细节在于使用了 turbo4 4.25-bit KV 缓存量化，这让一...

## 推荐理由

HKR 三项都站得住：提速和长上下文对本地 agent 是实打实的吸引力，帖子里机制和数字都列清楚了，成本优势也直接。不过只有 Reddit 单源，配置也有点折腾，所以放在 featured 低位。

## 锐评

这条分享的亮点是 MTP（多令牌预测）终于让 Qwen 3.6 27B 在本地 Mac 上有了可用的速度。作者在 M2 Max 96GB 上实测生成速度 28 tok/s，比之前快了 2.5 倍，这个数字对本地跑代码 agent 来说算是跨过了“能用”的门槛。

关键技巧在于 turbo4 4.25-bit KV 缓存量化，让 48GB 显存的 Mac 也能用 Q5_K_M 量化模型跑满 262k 上下文。这解决了大上下文本地部署最头疼的显存问题。作者还提供了 GGUF 编译步骤和兼容 OpenAI/Anthropic 接口的服务端命令，上手门槛不高。

不过要打个折：帖子正文被 Reddit 屏蔽了，具体测试条件、prompt 长度、是否稳定复现都看不到。MTP 对代码生成这类长输出任务提速明显，但短对话场景收益可能没那么大。另外 turbo4 量化对输出质量的影响也没提，这点先别太激动。
