Luce Spark:让 35B 的 MoE 模型在 16GB 显存上跑起来,不用忍受传统卸载的速度惩罚
Luce Spark: a 35B MoE on a 16 GB GPU, without the offload tax
Luce Spark 是一个开源方案,能让 Qwen3.6 35B-A3B 这种规模的混合专家模型在 RTX 3090 上只占 13.3 GiB 显存,跑出约 100 tok/s 的速度。它的做法是把模型里经常被用到的“热门专家”常驻在 GPU 显存里,不常用的“冷门专家”留在系统内存,需要时再异步搬运到 GPU 上一个固定大小的缓存区,搬运过程会和计...
推荐理由:标题本身就是一个强钩子,35B MoE 塞进 16 GB 卡还免掉 offload 税,对玩本地推理的人来说吸引力很大。文章把技术思路翻译得很清楚:把经常被调用的专家留在 GPU 上,不常用的放内存,用的时候再异步搬进一个固定大小的缓存区,搬运和计算重叠进行,所以能跑到约 100 tok/s,峰值显存只吃 13.3 GiB。不过信息源主要来自 Reddit 帖子,没有第三方复现或更严谨的基准测试,所以重要性先给到 78,等有更多验证再往上调。