跳到正文
Hacker News 首页

Colibrì:一个纯 C 引擎,让 744B 参数的 GLM 5.2 在 32GB 内存、无显卡的笔记本上跑起来

Show HN: Getting GLM 5.2 running on my slow computer

作者用一台 12 核、25GB 可用内存的笔记本,把 GLM 5.2 这个 7440 亿参数的大模型跑通了,没用到显卡。做法是把模型切成两块:注意力层、共享专家等约 170 亿参数的稠密部分,用 int4 量化后常驻内存,占大约 9.9GB;剩下的 21504 个路由专家(约 370GB)全扔在硬盘上,用到哪个才读哪个,靠 LRU 缓存和操作系统自己的...

推荐理由:作者用一台 12 核、25GB 内存的笔记本跑通了 GLM 5.2,没用到显卡。核心思路是把模型切成两块:注意力层和共享专家约 170 亿参数做 int4 量化后常驻内存,占 9.9GB;剩下 21504 个路由专家约 370GB 全放硬盘,靠 LRU 缓存和操作系统页缓存按需加载。正文给了具体数字和做法,不是公关稿,对想在自己机器上试大模型的人有参考价值。我会先打个折——推理速度肯定慢,但能跑起来本身就说明这套拆分加缓存的路子可行。

读原文 ↗导出 Markdown