Swiftlet 让 Mac 用 4.3 GB 内存跑 80B 模型,iPhone 也能跑 35B
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版
Swiftlet 用 Swift 和 Metal 重写了 MoE 模型的推理方式,只把一个小型稠密核心常驻内存,专家权重按需从存储流式加载,不用全塞进内存。一个 80B 的 Qwen3-Next 在 Mac 上只占 4.3 GB 内存,35B 模型能跑在 iPhone 上。正文没给出延迟或每秒 token 数,所以实时性先别太期待。
推荐理由:Swiftlet 用 Swift 和 Metal 重写了 MoE 推理,让 80B 模型在 Mac 上只占 4.3 GB 内存,35B 模型能跑在 iPhone 上——工程路径具体,数字也够震撼,HKR 三条全中。正文没给延迟或每秒 token 数,所以实时性先别太激动,但技术方向和内存节省本身已经值得关注。