# PrismML 发布 Bonsai 27B：第一个能在手机上跑的 270 亿参数模型

> 原标题：Bonsai 27B (1-bit LLM): The First 27B-Class Model to Run on a Phone

- 来源：Hacker News 首页
- 发布时间：2026-07-14T17:50:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44320
- 原文：https://prismml.com/news/bonsai-27b

## 摘要

PrismML 把 Qwen3.6 27B 压缩到了 3.9 GB，塞进了 iPhone 17 Pro。他们做了两个版本：三元版（5.9 GB）保留了原版 95% 的能力，1-bit 版（3.9 GB）保留了 90%。数学和编程分数几乎没掉，工具调用也撑住了，但视觉任务退化比较明显。两个版本都能处理图像，支持 26 万 token 的上下文和投机解码加...

## 推荐理由

PrismML 把 Qwen3.6 27B 压到 3.9 GB，装进 iPhone 17 Pro，三元版 5.9 GB 保留 95% 能力，1-bit 版 3.9 GB 保留 90%。数学和编程分数稳住了，工具调用也没崩，但视觉任务退化明显，这点先别太激动。正文没披露推理延迟和功耗，实际用起来烫不烫手还不清楚。整体是端侧部署的一个里程碑，但视觉短板和缺失的实测数据要打个折。

## 锐评

这条新闻最值得看的是压缩比：一个 27B 参数的模型，原本要占 54GB 显存，现在 1-bit 版只要 3.9GB，能在 iPhone 17 Pro 上跑。数学和编程分数确实稳，三元版只掉了不到 2 分，1-bit 版掉了不到 4 分，说明推理类任务对这种极端量化不敏感。

但别急着激动。视觉任务从 72.6 掉到 59.6，工具调用从 80 掉到 66，这两个跌幅不小。如果你想让它在手机上帮你操作 App、读截图，体验可能还差点意思。另外，正文只给了跑分，没提生成速度、耗电和发热——这些才是手机上能不能用的关键。PrismML 说支持投机解码来加速，但实际延迟多少，得等有人实测才知道。

模型用 Apache 2.0 开源，这点不错。如果功耗和延迟能接受，把 agent 工作流搬到本地跑，确实能省掉每次调 API 的钱，数据也不用出手机。
