# 用 12GB 显存跑 Qwen3.6 35B A3B，llama.cpp MTP 实测跑到 80 tok/s、128K 上下文

> 原标题：80 tok/sec and 128K context on 12GB VRAM with Qwen3.6 35B A3B and llama.cpp MTP

- 来源：r/LocalLLaMA
- 发布时间：2026-05-09T11:57:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16615
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t82zxv/80_toksec_and_128k_context_on_12gb_vram_with/

## 摘要

Reddit 用户 janvitos 在 RTX 4070 Super（12GB 显存）上跑 Qwen3.6-35B-A3B-MTP-GGUF，搭配 llama.cpp 的一个 MTP 拉取请求。他贴出的实测数据是每秒 69.2 到 81.9 个 token，草稿接受率在 0.694 到 0.947 之间，上下文长度拉到 131072。关键设置是 -f...

## 推荐理由

这条帖子是单用户实测，不是官方数据，验证强度有限，但数字和配置都摆出来了，可复现。对想在家用显卡上跑长上下文模型的人来说，是个很具体的参考点。我会先打个折，毕竟只有一个人晒结果，但 12GB 显存跑 35B 还能 80 tok/s，这点确实让人想试试。

## 锐评

这条帖子最抓眼球的是数字：一块 RTX 4070 Super（12GB 显存）上，Qwen3.6-35B-A3B 这个 MoE 模型跑出了每秒 69 到 82 个 token 的速度，上下文拉到 131072，草稿接受率最高 0.947。怎么做到的？核心是 llama.cpp 的一个 MTP（多 token 预测）拉取请求，配合 -fitt 1536 参数，从显存里专门划了 1.5GB 给草稿模型和 KV 缓存用。

先打个折：这是单个用户 janvitos 贴出的实测，不是官方基准，也没说测试用的 prompt 是什么、输出长度多少、温度设的多少。草稿接受率 0.694 到 0.947 这个范围本身就说明波动不小，低的时候相当于每三个草稿 token 就有一个被扔掉，实际加速效果会打折扣。另外，正文被 Reddit 的网络安全拦截了，我们看不到完整的设置细节和讨论，只能根据摘要判断。

对想在家用消费级显卡跑大模型的人来说，这个方向值得关注——MoE 架构本身激活参数少，MTP 又让模型一次猜好几个 token，确实可能把门槛压到 12GB 这个量级。但还缺几样东西：不同任务下的稳定性数据、长上下文时注意力机制会不会崩、以及这个 MTP PR 什么时候能合进 llama.cpp 主线。
