llama.cpp 新 PR 加入 Maple 20B-A1B 三值 MoE 架构,主打 CPU 推理
llama: add Maple 20B-A1B ternary MoE architecture (CPU) by AlexGabbia · Pull Request #27000 · ggml-org/llama.cpp
Reddit 用户 AlexGabbia 给 llama.cpp 提了个 PR(#27000),加入 Maple 20B-A1B 模型架构。总参数量 20B,但每次推理只激活 1B(MoE 的稀疏激活),权重只有三个值:-1、0、1(三值量化),内存和计算量都砍得很低,目标是让普通 CPU 也能跑大模型。正文被 Reddit 屏蔽了,没披露具体性能数字...