# 复旦等团队提出 HERMES：把 KV 缓存当分层记忆用，流式视频理解首 token 延迟最高降 10 倍

> 原标题：记得住、答得快、用得省：HERMES 让流式视频理解实时响应提速10倍

- 来源：机器之心 · 公众号
- 发布时间：2026-04-24T09:06:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9781
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651029959&idx=3&sn=727974231a8a62b512461c7b6c148c9d

## 摘要

这篇讲的是复旦大学、上海科学智能研究院和新加坡国立大学一起搞的 HERMES，一个不用重新训练就能加速流式视频理解的框架。核心思路是把模型里的 KV 缓存（你可以理解成模型在推理时记下的“草稿纸”）重新组织成三层记忆：当前帧的短期记忆、最近几帧的中期记忆，以及更早帧压缩后的长期记忆。同时它做了跨层记忆平滑和位置重编号，让模型读这段压缩历史时不会因为位置...

## 推荐理由

我会先打个折：这是学术研究，不是产品发布，所以重要性停在 82。但 HKR 三项都站得住——10 倍提速是实打实的标题钩子，68% token 削减和 27-29ms TTFT 是能拿来算账的数字，而且方案免训练、开源，对做流式视频落地的团队来说，省 token 就是省钱，低延迟就是体验。正文没披露长视频下的记忆退化情况和更多模型上的泛化结果，这点先别太激动，但现有数据已经够让做实时视频 agent 的人认真看一遍。

## 锐评

这条工作最直接的价值是省钱省时间：它不靠外挂资料库，也不重新训练模型，只通过重新组织 KV 缓存——也就是模型推理时记下的中间结果——把流式视频的首次响应时间压到 27 到 29 毫秒，比原来快 10 倍。同时视频 token 数少了 68%，Qwen2.5-VL-7B 在 StreamingBench 上的分数从 73.31% 拉到 79.44%，说明压缩没把关键信息压丢。

不过要冷静看两点。第一，原文因为环境验证问题没抓到完整技术细节，跨层记忆平滑和位置重编号具体怎么实现、会不会引入额外计算开销，目前只能从摘要里推测。第二，测试集中在 16 到 256 帧，更长视频下三层记忆的切换策略和遗忘曲线没给数据，实际落地时这块容易翻车。如果你在做实时视频理解且对延迟敏感，这个方法值得试，但建议先拿自己的长视频场景测一下记忆衰减。
