# 在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

> 原标题：Running Qwen3.5 / Qwen3.6 with NextN MTP (Multi-Token Prediction) speculative decode in llama.cpp — single RTX 3090 Ti GPU guide

- 来源：r/LocalLLaMA
- 发布时间：2026-05-07T09:56:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15567
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t65vl8/running_qwen35_qwen36_with_nextn_mtp_multitoken/

## 摘要

Reddit 用户分享了一个 llama.cpp 实操指南，用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP（多 token 预测，一种让模型一次猜好几个词来加速生成的技术）。目前需要打两个还没合并的 PR：#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

## 推荐理由

我会先打个折：这是 Reddit 个人指南，依赖两个没合进主线的 PR，稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s，还点出了 nextn=q8_0 量化覆盖这个坑，漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说，这份功耗、频率、KV 缓存设置都给了，可操作性强。正文没披露模型精度损失和长文本下的速度衰减，这点先别太激动。

## 锐评

这条实操指南挺实在，直接告诉你用一张 RTX 3090 Ti 跑 Qwen 3.5 和 3.6 的 NextN MTP 能到什么水平。MTP 就是让模型一次猜好几个词，省掉反复推理的等待时间，实测 Qwen3.6-35B-A3B-MTP 跑到 157 tok/s，功耗 350W，频率 1700MHz，用了 q8 KV 缓存。这个速度对本地跑大尺寸模型来说相当能打。

但要注意，目前 llama.cpp 官方还没合并相关支持，得自己打 PR #22400 和 #22673 两个补丁。最关键的一个坑是 nextn 层必须用量化覆盖参数 q8_0，漏掉这一步模型会直接输出一串“////”，等于白跑。这点原文讲得很细，算是踩坑实录。

正文没披露测试用的具体 prompt 长度和 batch size，也没提输出质量有没有因为 MTP 打折扣。另外 Reddit 原文被网络屏蔽，我们只能看到摘要，没法核实更多细节。如果你打算复现，先确认这两个 PR 跟你用的 llama.cpp 版本兼容，别一上来就编译。
