MiniMax 开源 MSA 稀疏注意力:109B 模型处理百万 token 时注意力计算量砍掉 28.4 倍
MiniMax Sparse Attention (MSA)
MiniMax 发了一篇论文,提出一种叫 MSA 的稀疏注意力方法,专门解决超长上下文推理时注意力计算太贵的问题。它的做法是在 GQA(分组查询注意力)基础上加一个轻量的“索引分支”,先给每块 KV 缓存打分,每个查询组只挑分数最高的一小部分块,主分支再对这些挑出来的块做精确注意力计算。配合专门写的 GPU 内核,一个 109B 参数的多模态模型在 H...
推荐理由:这篇不是纯理论,有具体机制和实测数字,对搞推理加速的人是真干货。但内容偏底层 CUDA 优化,一般读者上手门槛高,所以推荐度上我稍微收了一点,整体还是值得放进精选。