MemStitch:一个给 vLLM 用的零拷贝上下文桥接网关,多智能体场景下首 token 延迟最多降 25 倍
DaqulaLin 开源了 MemStitch,一个架在 vLLM 前面的网关。它利用 PagedAttention 直接在显存里拼接不同请求的 KV 缓存,让多智能体协作时不用反复做预填充,首 token 延迟最多能降 25 倍,显存占用也省了 40% 以上。不过正文没披露测试用的模型和 GPU 配置,25 倍这个数字先打个折看,等具体环境信息出来再说。
推荐理由:多智能体推理延迟是个真实痛点,MemStitch 在 vLLM 显存层做 KV 缓存拼接,比 prompt 层面的方案更根本。25 倍这个数字正文没给模型和 GPU 配置,先打个折,但机制本身值得关注。