# Luce Spark：让 35B 的 MoE 模型在 16GB 显存上跑起来，不用忍受传统卸载的速度惩罚

> 原标题：Luce Spark: a 35B MoE on a 16 GB GPU, without the offload tax

- 来源：r/LocalLLaMA
- 发布时间：2026-06-08T15:24:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35623
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u0b3cu/luce_spark_a_35b_moe_on_a_16_gb_gpu_without_the/

## 摘要

Luce Spark 是一个开源方案，能让 Qwen3.6 35B-A3B 这种规模的混合专家模型在 RTX 3090 上只占 13.3 GiB 显存，跑出约 100 tok/s 的速度。它的做法是把模型里经常被用到的“热门专家”常驻在 GPU 显存里，不常用的“冷门专家”留在系统内存，需要时再异步搬运到 GPU 上一个固定大小的缓存区，搬运过程会和计...

## 推荐理由

标题本身就是一个强钩子，35B MoE 塞进 16 GB 卡还免掉 offload 税，对玩本地推理的人来说吸引力很大。文章把技术思路翻译得很清楚：把经常被调用的专家留在 GPU 上，不常用的放内存，用的时候再异步搬进一个固定大小的缓存区，搬运和计算重叠进行，所以能跑到约 100 tok/s，峰值显存只吃 13.3 GiB。不过信息源主要来自 Reddit 帖子，没有第三方复现或更严谨的基准测试，所以重要性先给到 78，等有更多验证再往上调。

## 锐评

这个方案解决了一个很实际的痛点：想把 35B 规模的混合专家模型塞进 16GB 显存的卡里，又不想速度崩盘。做法是把模型里 256 个专家中经常被用到的“热门专家”常驻 GPU，冷门专家留在系统内存，需要时再异步搬运到 GPU 上一个固定大小的缓存区。搬运过程跟计算重叠，不会让整个推理卡住。在 RTX 3090 上，Qwen3.6 35B-A3B 的显存占用从约 20.5 GiB 压到 13.3 GiB，速度还能维持在约 100 tok/s，相当于全 GPU 推理的 85%。

不过要打几个折。第一，测试是在 24GB 的 3090 上跑的，虽然峰值显存低于 16GB，但还没在真正的 16GB 卡上验证过，实际表现可能有出入。第二，跟 llama.cpp 的 --n-cpu-moe 方案还没做过同条件对比，不知道优势到底多大。第三，最后那 15% 的速度差距想追平很难，因为靠预测下一个专家来提前搬运，准确率上限只有 53% 左右，这不是调参能解决的问题。另外，正文没披露冷门专家被命中时的具体延迟惩罚是多少，只说“损失吞吐量但不卡住”，这个代价到底多大需要实测才知道。
