跳到正文
Hacker News 首页

TurboFieldfare:让 8GB Mac 跑起 26B 模型,内存只占 2GB

Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac

一个用 Swift 和 Metal 写的推理引擎,能在任何 M 系列 Mac 上跑 Gemma 4 26B 模型,内存占用压到 2GB 左右。模型本身 4-bit 量化后还有 14GB 大,常规工具在 8GB 内存的 Mac 上根本跑不动。它的做法是把模型共享层和 KV 缓存留在内存里,每个 token 需要用到的那部分“专家”参数才临时从 SSD 流...

推荐理由:一个开源推理引擎,用 Swift 和 Metal 实现,让 Gemma 4 26B 在 M 系列 Mac 上仅占 2GB 内存就能跑。技术细节交代清楚:4-bit 量化、共享层常驻、专家参数按 token 从 SSD 流式加载。对内存受限的 Mac 用户实用价值很高。不过这是个人项目,正文没给出推理速度和基准测试数据,实际可用性要打个问号,所以分数卡在 78。

读原文 ↗导出 Markdown