老显卡 GTX 1080 跑 30B 混合专家模型,每秒能出 24 个 token
24+ tok/s from ~30B MoE models on an old GTX 1080 (8 GB VRAM, 128k context)
用户 mdda 在一台老机器(i7-6700、GTX 1080 8GB 显存、32GB 内存)上跑 Qwen 3.6 35B-A3B 这类约 300 亿参数的混合专家模型,推理速度到了每秒 24 个 token 左右,上下文窗口开到 128k。他的做法是把模型里的一部分专家层卸载到显卡上跑,其余放内存,同时用 TurboQuant 和 RotorQua...
推荐理由:单条 Reddit 帖子权威性不高,但配置和数字很具体,对想用老硬件跑大模型的从业者有参考价值。我会先打个折,这不算正式产品发布或模型更新,但实操信息够硬,适合放进 featured。