# 一张 RTX 3060 12GB 跑通 Qwen3.6-35B-A3B，128K 上下文生成速度 37 token/秒

> 原标题：Qwen3.6-35B-A3B-APEX / 128K ctx on RTX 3060 12GB — 37 t/s gen with 72k ctx filled, PPL 3.25, offloading 17GB model

- 来源：r/LocalLLaMA
- 发布时间：2026-05-28T11:12:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/29490
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tq0h1p/qwen3635ba3bapex_128k_ctx_on_rtx_3060_12gb_37_ts/

## 摘要

用户 old-mike 在一张 RTX 3060 12GB 显卡上，用 spiritbuun 的 llama.cpp 优化分支和 mudler 的 APEX 量化模型，成功跑起了 17.3GB 的 Qwen3.6-35B-A3B。在已填充 72K 上下文时，生成速度达到 37.17 token/秒；上下文塞到 129K 时，速度仍有 28.08 tok...

## 推荐理由

HKR 三项都踩中了。一个 Reddit 用户用消费级显卡跑通 35B 大上下文，还给出了速度和困惑度，对本地推理圈子是实打实的参考。信息来自单篇帖子，影响范围也就在本地推理场景，所以放在 featured 而不是 P1。

## 锐评

这条帖子最直接的价值是给了一张消费级显卡跑大模型的实操参考。用户用一张RTX 3060 12GB，通过spiritbuun的llama.cpp优化分支和mudler的APEX量化，把17.3GB的Qwen3.6-35B-A3B模型跑了起来。在已填充72K上下文时，生成速度达到37 token/秒，上下文塞到129K时仍有28 token/秒，PPL 3.25。这个速度对于12GB显存的卡来说相当不错，说明针对CUDA的底层优化和特定的量化格式确实能压榨出更多性能。

不过得给这个结果打个折。首先，这是单次个人测试，没有披露测试用的具体文本类型和生成内容的质量，PPL 3.25也只是在enwik8上的跑分，不代表实际对话或推理任务的表现。其次，帖子提到MTP（多token预测）在这个配置下反而拖慢速度41%，这点挺反直觉，作者自己也解释不清，只猜测是显存布局问题。另外，虽然做了大海捞针测试且100%找回，但用的是学术markdown文本，跟真实场景的乱糟糟文档有差距。

还缺什么？没给功耗、温度数据，也没测更复杂的推理或代码任务。长上下文下的输出一致性、幻觉率都没提。如果你也想在12G卡上跑这个模型，可以参考他的命令行参数，但别指望所有场景都能复现这个速度。
