# RTX 5080 16GB 跑长上下文编程：Qwen3.6-35B-A3B 在 128K 窗口下稳在 30 t/s，刚启动时能到 89 t/s

> 原标题：Long-context coding on RTX 5080 16GB: Qwen3.6-35B-A3B holds 30 t/s at 128K (89 t/s fresh), no quality drop

- 来源：r/LocalLLaMA
- 发布时间：2026-04-30T20:19:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12269
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t07s6x/longcontext_coding_on_rtx_5080_16gb_qwen3635ba3b/

## 摘要

一位 Reddit 用户用 RTX 5080 16GB 显卡本地跑编程 agent，测了 Qwen3.6-35B-A3B 这个 MoE 模型（总参数 35B，每次激活 3B）。刚加载完上下文时速度有 89 t/s，等上下文塞满到 128K token 后，生成速度还能维持在 30 t/s，而且回复质量没掉。作为对比，同系列的 27B 稠密模型在 128...

## 推荐理由

HKR 三项都成立：16GB 显卡撑住 128K 上下文 30 t/s 是个很强的钩子，硬件和 CUDA 版本细节都有，还给了稠密模型的惨烈对比。不过这只是 Reddit 单帖测试，没有多源复现，所以 featured 而不是 P1。

## 锐评

这条帖子的标题信息量很大：用一张 16GB 显存的 RTX 5080，跑 Qwen3.6-35B-A3B 这个混合专家模型（总参数 35B，每次只激活 3B），在上下文塞满 128K token 后，生成速度还能维持在每秒 30 个 token，刚加载完时甚至能到 89 t/s。作为对比，同系列的 27B 稠密模型在同样条件下只剩 3.2 t/s，差距接近 10 倍。这个速度对本地跑编程 agent 来说完全可用，说明 MoE 架构配合 KV 缓存量化，确实能让消费级显卡吃下长上下文任务。

但这条信息得打个大折扣。Reddit 原帖被屏蔽了，我们只能看到标题和摘要里提到的硬件配置（Ryzen 9700X、96GB DDR5、Windows 11、CUDA 12.9.1），具体的测试方法、量化精度、上下文是否真的填满 128K、回复质量怎么判断的，正文里全都没披露。30 t/s 是在什么批处理大小下测的？KV 缓存量化到几比特？这些关键变量一概不知。另外，MoE 模型虽然激活参数少，但总参数量大，对内存带宽和 CPU 卸载的要求不低，96GB 系统内存可能才是撑住 128K 上下文的关键，不能简单归功于显卡。

还缺什么：完整的测试脚本和可复现的配置、不同量化级别下的速度对比、回复质量的具体评估标准、以及更贴近真实编程 agent 工作流的延迟测试。如果作者能补上这些，这条信息对想在本地跑长上下文编程模型的人会很有参考价值。
