跳到正文
r/LocalLLaMA

用 12GB 显存跑 Qwen3.6 35B A3B,llama.cpp MTP 实测跑到 80 tok/s、128K 上下文

80 tok/sec and 128K context on 12GB VRAM with Qwen3.6 35B A3B and llama.cpp MTP

Reddit 用户 janvitos 在 RTX 4070 Super(12GB 显存)上跑 Qwen3.6-35B-A3B-MTP-GGUF,搭配 llama.cpp 的一个 MTP 拉取请求。他贴出的实测数据是每秒 69.2 到 81.9 个 token,草稿接受率在 0.694 到 0.947 之间,上下文长度拉到 131072。关键设置是 -f...

推荐理由:这条帖子是单用户实测,不是官方数据,验证强度有限,但数字和配置都摆出来了,可复现。对想在家用显卡上跑长上下文模型的人来说,是个很具体的参考点。我会先打个折,毕竟只有一个人晒结果,但 12GB 显存跑 35B 还能 80 tok/s,这点确实让人想试试。

读原文 ↗导出 Markdown