SGLang 搞了个“权重缓存守护进程”,让大模型引擎重启不到 1 秒
SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启
SGLang 发布了一个叫 Weight Cache Daemon 的新组件。它的思路很简单:把模型量化、切分好的权重直接留在 GPU 显存里,由一个常驻进程看管。当引擎需要重启时,新进程通过 CUDA IPC 直接“零拷贝”映射这些现成的权重,省掉了从硬盘重新读数据、反序列化、再量化的全套流程。在 Ling-2.6-1T FP8 模型上实测,权重加载...
推荐理由:SGLang 这个 Weight Cache Daemon 抓的问题很实在:引擎重启时重新加载权重太慢,等得人心焦。它用 CUDA IPC 零拷贝的思路很干净,直接把量化好的权重留在显存里给新进程用,Ling-2.6-1T FP8 的实测也给了交代。分数没打满是因为这事主要利好搞推理部署的人,受众面窄了点,但对他们来说,这可能是本周最实用的更新。