跳到正文
AI HOT 精选

小红书 RedKnot 把 KV Cache 按注意力头拆开,长文本推理更快了

小红书 RedKnot 推理引擎:将 KV Cache 按注意力头拆解实现长文本加速

RedKnot 发现 83.4% 到 96.8% 的注意力头其实只关心局部上下文,于是它不再给所有头都存完整的 KV Cache,而是按头拆开、各用各的稀疏策略。配合稀疏 FFN 和 SegPagedAttention,在 8 卡 H800 上首 token 延迟最高快了 3.54 倍,单卡并发能扛 7.8 倍,预填充计算量砍掉 67% 到 79.5%...

推荐理由:小红书 RedKnot 团队发现大部分注意力头其实只盯眼前,就给每个头单独配稀疏策略,不再一刀切存全量 KV Cache。8 卡 H800 上首 token 延迟最高快 3.54 倍,单卡并发能扛 7.8 倍,预填充计算量砍掉 67% 到 79.5%,这些数字说明省得挺实在。不过正文没披露精度损失的具体测试,这点先别太激动。整体是推理部署的硬核优化,对做 serving 的人很实用,但对不碰推理管线的读者可能没那么大吸引力。

读原文 ↗导出 Markdown