# llama.cpp 新 PR 加入 Maple 20B-A1B 三值 MoE 架构，主打 CPU 推理

> 原标题：llama: add Maple 20B-A1B ternary MoE architecture (CPU) by AlexGabbia · Pull Request #27000 · ggml-org/llama.cpp

- 来源：r/LocalLLaMA
- 发布时间：2026-09-14T12:11:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56466
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1wg1o5b/llama_add_maple_20ba1b_ternary_moe_architecture/

## 摘要

Reddit 用户 AlexGabbia 给 llama.cpp 提了个 PR（#27000），加入 Maple 20B-A1B 模型架构。总参数量 20B，但每次推理只激活 1B（MoE 的稀疏激活），权重只有三个值：-1、0、1（三值量化），内存和计算量都砍得很低，目标是让普通 CPU 也能跑大模型。正文被 Reddit 屏蔽了，没披露具体性能数字...
