# MemStitch：一个给 vLLM 用的零拷贝上下文桥接网关，多智能体场景下首 token 延迟最多降 25 倍

> 原标题：Show HN: MemStitch – Zero-copy context bridging for vLLM (25x TTFT speedup)

- 来源：Hacker News 首页
- 发布时间：2026-07-14T01:04:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44134
- 原文：https://github.com/DaqulaLin/MemStitch

## 摘要

DaqulaLin 开源了 MemStitch，一个架在 vLLM 前面的网关。它利用 PagedAttention 直接在显存里拼接不同请求的 KV 缓存，让多智能体协作时不用反复做预填充，首 token 延迟最多能降 25 倍，显存占用也省了 40% 以上。不过正文没披露测试用的模型和 GPU 配置，25 倍这个数字先打个折看，等具体环境信息出来再说。

## 推荐理由

多智能体推理延迟是个真实痛点，MemStitch 在 vLLM 显存层做 KV 缓存拼接，比 prompt 层面的方案更根本。25 倍这个数字正文没给模型和 GPU 配置，先打个折，但机制本身值得关注。

## 锐评

MemStitch 解决的是一个很实际的痛点：多智能体协作时，每个模型都要把共享的上下文重新算一遍，既慢又吃显存。它直接利用 vLLM 的 PagedAttention 机制，在显存里把不同请求的 KV 缓存拼起来，省掉了重复的预填充步骤。这思路挺巧，相当于让模型们共用一份草稿纸，不用各自重写。

性能提升看着很诱人，首 token 延迟降 25 倍，显存省 40% 以上。但正文没披露测试用的模型和 GPU 配置，这个数字的参考价值要打折扣。不同模型大小和硬件环境下，收益会差很多。另外，它作为网关架在 vLLM 前面，实际部署时会不会引入新的通信延迟，以及缓存拼接的稳定性如何，都还需要更多验证。

目前还缺的是：具体测试环境、对长上下文的压力测试结果，以及和现有方案（比如直接复用 prompt cache）的对比数据。如果这些补上，对跑多智能体工作流的人来说是个省钱省时的好东西。
