# Colibrì：一个纯 C 引擎，让 744B 参数的 GLM 5.2 在 32GB 内存、无显卡的笔记本上跑起来

> 原标题：Show HN: Getting GLM 5.2 running on my slow computer

- 来源：Hacker News 首页
- 发布时间：2026-07-09T08:05:04.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43551
- 原文：https://github.com/JustVugg/colibri

## 摘要

作者用一台 12 核、25GB 可用内存的笔记本，把 GLM 5.2 这个 7440 亿参数的大模型跑通了，没用到显卡。做法是把模型切成两块：注意力层、共享专家等约 170 亿参数的稠密部分，用 int4 量化后常驻内存，占大约 9.9GB；剩下的 21504 个路由专家（约 370GB）全扔在硬盘上，用到哪个才读哪个，靠 LRU 缓存和操作系统自己的...

## 推荐理由

作者用一台 12 核、25GB 内存的笔记本跑通了 GLM 5.2，没用到显卡。核心思路是把模型切成两块：注意力层和共享专家约 170 亿参数做 int4 量化后常驻内存，占 9.9GB；剩下 21504 个路由专家约 370GB 全放硬盘，靠 LRU 缓存和操作系统页缓存按需加载。正文给了具体数字和做法，不是公关稿，对想在自己机器上试大模型的人有参考价值。我会先打个折——推理速度肯定慢，但能跑起来本身就说明这套拆分加缓存的路子可行。

## 锐评

这个项目最值钱的地方是思路，不是速度。作者把 GLM 5.2 这个 7440 亿参数的 MoE 模型拆成两块：注意力层和共享专家这些约 170 亿参数的稠密部分，用 int4 量化后常驻内存，占大约 9.9GB；剩下 21504 个路由专家，总共约 370GB，全扔在硬盘上，用到哪个才读哪个，靠 LRU 缓存和操作系统自己的页缓存来提速。结果就是一台 12 核、25GB 可用内存的笔记本，没显卡，也能跟模型对话，冷启动速度 0.1 tok/s。

这个速度当然没法用，但作者也说了，他就是想看看能不能跑通，不在乎快慢。整个引擎是一个 1300 行的 C 文件，没有 BLAS、没有 Python 运行时、没有 GPU，这对想在低配硬件上做推理实验的人是个很干净的起点。

不过正文没披露 int4 量化后模型质量掉了多少，也没跟原版做对比评测。这点先别太激动，能跑通和能跑好是两回事。另外，370GB 的专家文件放在硬盘上，对磁盘 I/O 的压力不小，作者也没提 SSD 还是 HDD，这个细节会影响实际体验。如果是真的能在普通笔记本上把 7440B 模型跑出可用的质量，那确实省钱，但现在还缺质量数据和更完整的硬件环境说明。
