# 老显卡 GTX 1080 跑 30B 混合专家模型，每秒能出 24 个 token

> 原标题：24+ tok/s from ~30B MoE models on an old GTX 1080 (8 GB VRAM, 128k context)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-13T20:41:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19911
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tcc7h5/24_toks_from_30b_moe_models_on_an_old_gtx_1080_8/

## 摘要

用户 mdda 在一台老机器（i7-6700、GTX 1080 8GB 显存、32GB 内存）上跑 Qwen 3.6 35B-A3B 这类约 300 亿参数的混合专家模型，推理速度到了每秒 24 个 token 左右，上下文窗口开到 128k。他的做法是把模型里的一部分专家层卸载到显卡上跑，其余放内存，同时用 TurboQuant 和 RotorQua...

## 推荐理由

单条 Reddit 帖子权威性不高，但配置和数字很具体，对想用老硬件跑大模型的从业者有参考价值。我会先打个折，这不算正式产品发布或模型更新，但实操信息够硬，适合放进 featured。

## 锐评

这条分享来自Reddit用户mdda，他在一台i7-6700、GTX 1080 8GB显存、32GB内存的老机器上，用llama.cpp跑Qwen 3.6 35B-A3B这类约300亿参数的混合专家模型，推理速度到了每秒24个token左右，上下文窗口开到128k。做法是把模型的部分专家层卸载到显卡上跑，其余放内存，同时用TurboQuant和RotorQuant压缩KV缓存。PCIe 3.0 x16带宽被吃满，显卡利用率在40%到50%之间，说明瓶颈不在计算，而在数据传输。

这个速度对日常对话或辅助写作已经够用，但要注意，24 tok/s是在特定模型和量化方案下达成的，换其他MoE模型未必能复现。正文没披露具体的量化精度和卸载比例，也没提首token延迟，这两个指标对实际体验影响很大。另外，128k上下文下KV缓存压缩后的质量损失也没给出对比数据，这点先别太激动。

如果你手头有类似的老卡，这条经验值得一试，但最好先确认自己的主板PCIe带宽是否够，以及内存频率对速度的影响有多大，这些正文都没展开。
