# Swiftlet 让 Mac 用 4.3 GB 内存跑 80B 模型，iPhone 也能跑 35B

> 原标题：Swiftlet：在 Mac 上运行 80B 版 Qwen（内存 4.3 GB），在 iPhone 上运行 35B 版

- 来源：AI HOT 精选
- 发布时间：2026-08-04T06:32:44.149Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48606
- 原文：https://github.com/leonickson1/Swiftlet

## 摘要

Swiftlet 用 Swift 和 Metal 重写了 MoE 模型的推理方式，只把一个小型稠密核心常驻内存，专家权重按需从存储流式加载，不用全塞进内存。一个 80B 的 Qwen3-Next 在 Mac 上只占 4.3 GB 内存，35B 模型能跑在 iPhone 上。正文没给出延迟或每秒 token 数，所以实时性先别太期待。

## 推荐理由

Swiftlet 用 Swift 和 Metal 重写了 MoE 推理，让 80B 模型在 Mac 上只占 4.3 GB 内存，35B 模型能跑在 iPhone 上——工程路径具体，数字也够震撼，HKR 三条全中。正文没给延迟或每秒 token 数，所以实时性先别太激动，但技术方向和内存节省本身已经值得关注。

## 锐评

Swiftlet 的思路很直接：MoE 模型不是所有参数都要同时用，它把一个小型稠密核心常驻内存，专家权重按需从存储流式加载，不用把整个模型塞进内存。一个 80B 的 Qwen3-Next 在 Mac 上只占 4.3 GB 内存，35B 模型能跑在 iPhone 上，这对本地跑大模型来说内存门槛降了不少。

但正文没披露延迟和每秒 token 数，这是最大的信息缺口。按需从存储读专家权重，意味着每次推理都可能触发磁盘或闪存读取，速度大概率比全内存加载慢。如果只是跑批处理或离线任务，慢一点可以接受；如果是聊天或实时交互，体验可能还不行。另外也没说支持哪些量化精度、不同设备上的实际功耗和发热情况。

这点先别太激动。内存占用低是实打实的工程优化，但能不能用、好不好用，还得等有人实测出延迟和生成速度再说。
