# 小红书 RedKnot 把 KV Cache 按注意力头拆开，长文本推理更快了

> 原标题：小红书 RedKnot 推理引擎：将 KV Cache 按注意力头拆解实现长文本加速

- 来源：AI HOT 精选
- 发布时间：2026-06-29T11:00:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41241
- 原文：https://mp.weixin.qq.com/s/qRrZvL0aZzYI82djFSrLug

## 摘要

RedKnot 发现 83.4% 到 96.8% 的注意力头其实只关心局部上下文，于是它不再给所有头都存完整的 KV Cache，而是按头拆开、各用各的稀疏策略。配合稀疏 FFN 和 SegPagedAttention，在 8 卡 H800 上首 token 延迟最高快了 3.54 倍，单卡并发能扛 7.8 倍，预填充计算量砍掉 67% 到 79.5%...

## 推荐理由

小红书 RedKnot 团队发现大部分注意力头其实只盯眼前，就给每个头单独配稀疏策略，不再一刀切存全量 KV Cache。8 卡 H800 上首 token 延迟最高快 3.54 倍，单卡并发能扛 7.8 倍，预填充计算量砍掉 67% 到 79.5%，这些数字说明省得挺实在。不过正文没披露精度损失的具体测试，这点先别太激动。整体是推理部署的硬核优化，对做 serving 的人很实用，但对不碰推理管线的读者可能没那么大吸引力。

## 锐评

这条技术路线挺聪明：RedKnot 先统计出 83.4% 到 96.8% 的注意力头其实只关心附近几十个 token，那给这些头存完整长序列就是浪费。他们干脆按头分配稀疏策略，局部头只留局部 KV，全局头才看全图，再配上稀疏 FFN 和 SegPagedAttention 把存储和计算粒度对齐。在 8 卡 H800 上，首 token 延迟最高降了 3.54 倍，单卡并发能扛原来的 7.8 倍，预填充计算量砍掉六七成。DeepSeek-V4-Flash 跑 128K 上下文时首 token 加速 5.16 倍，KV 传输量最多省 6.3 倍，精度保持在稠密模型的 95% 以上。

不过正文没披露这个精度是在哪些 benchmark 上测的，也没说稀疏策略对不同任务类型（比如需要长程推理的文档问答）会不会掉得更厉害。另外，这套方法依赖对注意力头的分类，如果换一个模型架构或训练数据分布，局部头的比例会不会变，文章也没提。如果是真的稳定，这比单纯砍层数或量化 KV 来得更精细，值得跟一下后续开源代码和更多模型上的复现结果。
