# llama.cpp 新分支让 MoE 模型在 12GB 显存上跑得更快，RTX 2060 上速度从 19/22 tk/s 提到 26 tk/s

> 原标题：Experts first llama.cpp

- 来源：r/LocalLLaMA
- 发布时间：2026-05-22T16:03:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25652
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tknbzh/experts_first_llamacpp/

## 摘要

comanderxv 给 llama.cpp 开了个叫“experts first”的分支，专门优化混合专家模型（MoE）的显存调度。做法是把常用的专家模块提前缓存到显存里，实测用 RTX 2060（12GB 显存）跑 Qwen3.6-35B-A3B 模型，专家缓存命中率约 62%，生成速度从原来的 19 或 22 token/秒提升到了 26 tok...

## 推荐理由

HKR 三项都踩中了：钩子是一块 12GB 的老卡把 35B MoE 速度拉上来一截，有缓存机制和命中率数据撑着，话题又打在本地推理的成本神经上。不过这事目前还局限在本地推理的小圈子，所以放在 featured 档刚好，不用拔到必读。

## 锐评

这个分支的思路很直接：混合专家模型（MoE）每次推理只激活一小部分专家，与其每次都从内存或硬盘现调，不如把最常用的那几个提前塞进显存里。实测用一张 RTX 2060（12GB 显存）跑 Qwen3.6-35B-A3B，生成速度从原来的 19 或 22 token/秒提到了 26 token/秒，提升幅度在 18% 到 37% 之间。

不过“专家缓存命中率约 62%”这个数字得看你怎么理解。它说明有将近四成的请求还是没命中缓存，该慢的时候照样慢。正文没交代这个命中率是在什么任务上测的——写代码、聊天、还是长文总结——不同场景下专家被激活的分布可能差很多，实际体验的波动会比平均速度大。

另外，这个分支目前只是个人 fork，还没合进 llama.cpp 主线。稳定性、兼容其他模型（比如 Gemma）的表现、以及缓存策略能不能自适应调整，正文都没提。如果你手头正好有 12GB 左右显存的卡想跑大 MoE 模型，可以试试，但别指望它对所有任务都稳定提速。
