这条帖子的标题信息量很大:用一张 16GB 显存的 RTX 5080,跑 Qwen3.6-35B-A3B 这个混合专家模型(总参数 35B,每次只激活 3B),在上下文塞满 128K token 后,生成速度还能维持在每秒 30 个 token,刚加载完时甚至能到 89 t/s。作为对比,同系列的 27B 稠密模型在同样条件下只剩 3.2 t/s,差距接近 10 倍。这个速度对本地跑编程 agent 来说完全可用,说明 MoE 架构配合 KV 缓存量化,确实能让消费级显卡吃下长上下文任务。
但这条信息得打个大折扣。Reddit 原帖被屏蔽了,我们只能看到标题和摘要里提到的硬件配置(Ryzen 9700X、96GB DDR5、Windows 11、CUDA 12.9.1),具体的测试方法、量化精度、上下文是否真的填满 128K、回复质量怎么判断的,正文里全都没披露。30 t/s 是在什么批处理大小下测的?KV 缓存量化到几比特?这些关键变量一概不知。另外,MoE 模型虽然激活参数少,但总参数量大,对内存带宽和 CPU 卸载的要求不低,96GB 系统内存可能才是撑住 128K 上下文的关键,不能简单归功于显卡。
还缺什么:完整的测试脚本和可复现的配置、不同量化级别下的速度对比、回复质量的具体评估标准、以及更贴近真实编程 agent 工作流的延迟测试。如果作者能补上这些,这条信息对想在本地跑长上下文编程模型的人会很有参考价值。