# DeepGrove 开源 Maple-Preview：一个 20B 参数的三值 MoE 模型，在 iPhone 上跑到 127 tok/s

> 原标题：Show HN: Maple-Preview – ternary 20B MoE running at 120 tok/s on a iPhone

- 来源：Hacker News 首页
- 发布时间：2026-08-04T19:44:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48734
- 原文：https://deepgrove.ai/maple-preview

## 摘要

DeepGrove 放出了一个叫 Maple-Preview 的开源模型，总参数量 200 亿，但每次推理只激活 10 亿参数，权重用的还是三值（-1, 0, 1），所以模型文件只有 5.31 GB。它在 M4 Mac mini 上能跑到每秒 218 个 token，在 iPhone 上跑到 127 tok/s，比 1-bit 的 Bonsai 27B...

## 推荐理由

一个三值权重的 MoE 模型能在手机上跑出 127 tok/s 还带奥数级推理能力，放在 featured 里没毛病。没给更高分是因为目前只有模型卡自报的数据，没有第三方跑分或真实场景验证，我会先打个折，82 分先挂着，等有人复现了再调。

## 锐评

Maple-Preview 最值得看的是它的三值权重设计：总参数200亿，每次推理只激活10亿，权重只有 -1、0、1 三种状态，所以模型文件压缩到了 5.31 GB。在 M4 Mac mini 上跑到每秒 218 个 token，iPhone 上 127 tok/s，比 1-bit 的 Bonsai 27B 快了 13 倍。这个速度对端侧部署确实友好，矩阵乘法可以简化成加法，省算力也省电。

推理成绩方面，它在 IMO 2024 第一题拿了满分 7 分，AIME 等推理基准上跟更大模型有来有回。但 DeepGrove 自己也在文章里说，智能体任务的表现可能跟不上纯推理分数，而且没有给出具体的智能体跑分。这点先别太激动，会做数学题不代表能在业务流程里稳定干活。

另外，正文没提训练数据来源、有没有做污染检查，也没说上下文 131K 在实际长文本任务里表现如何。这些缺口让模型的可复现性和泛化能力打了折扣。整体看，这是一个在端侧推理效率上很有想法的模型，但离“全能端侧助手”还差几项关键验证。
