# SGLang 搞了个“权重缓存守护进程”，让大模型引擎重启不到 1 秒

> 原标题：SGLang 推出 Weight Cache Daemon，实现亚秒级引擎重启

- 来源：AI HOT 精选
- 发布时间：2026-08-21T17:56:25.415Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52096
- 原文：https://www.lmsys.org/blog/2026-08-21-sglang-fast-recovery

## 摘要

SGLang 发布了一个叫 Weight Cache Daemon 的新组件。它的思路很简单：把模型量化、切分好的权重直接留在 GPU 显存里，由一个常驻进程看管。当引擎需要重启时，新进程通过 CUDA IPC 直接“零拷贝”映射这些现成的权重，省掉了从硬盘重新读数据、反序列化、再量化的全套流程。在 Ling-2.6-1T FP8 模型上实测，权重加载...

## 推荐理由

SGLang 这个 Weight Cache Daemon 抓的问题很实在：引擎重启时重新加载权重太慢，等得人心焦。它用 CUDA IPC 零拷贝的思路很干净，直接把量化好的权重留在显存里给新进程用，Ling-2.6-1T FP8 的实测也给了交代。分数没打满是因为这事主要利好搞推理部署的人，受众面窄了点，但对他们来说，这可能是本周最实用的更新。

## 锐评

这条值得点开看，因为它解决了一个生产环境里很肉疼的问题：大模型服务一挂，重启动辄几分钟，这段时间所有请求全废。SGLang 的 Weight Cache Daemon 思路很直接——既然每次重启最慢的环节是把模型从硬盘读进显存、再量化，那干脆让一个常驻进程把处理好的权重直接留在 GPU 显存里。新引擎启动时通过 CUDA IPC 直接映射这些现成数据，省掉了反序列化和量化的全套流程。

在 Ling-2.6-1T FP8 模型上实测，权重加载从约 495 秒降到约 0.63 秒，快了 785 倍，整体启动从 8.8 分钟压到 0.528 分钟。这个数字挺漂亮，但要注意测试环境是 8 张 H20-3e GPU，权重放在 3.5T 的 NVMe SSD 上，如果你的硬件配置不同，加速幅度会打折扣。另外，它还支持同一 GPU 上多个引擎实例共享权重、主备切换在 1 秒内完成，这对需要高可用的在线服务很实用。

正文没披露这个守护进程本身占多少显存、对正在运行的推理任务有没有性能干扰，也没提故障场景下守护进程自己挂了怎么办。这些是评估生产风险的关键信息，目前还缺。
