# MiniMax 开源 MSA 稀疏注意力：109B 模型处理百万 token 时注意力计算量砍掉 28.4 倍

> 原标题：MiniMax Sparse Attention (MSA)

- 来源：r/LocalLLaMA
- 发布时间：2026-06-12T14:55:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37862
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u3xl1i/minimax_sparse_attention_msa/

## 摘要

MiniMax 发了一篇论文，提出一种叫 MSA 的稀疏注意力方法，专门解决超长上下文推理时注意力计算太贵的问题。它的做法是在 GQA（分组查询注意力）基础上加一个轻量的“索引分支”，先给每块 KV 缓存打分，每个查询组只挑分数最高的一小部分块，主分支再对这些挑出来的块做精确注意力计算。配合专门写的 GPU 内核，一个 109B 参数的多模态模型在 H...

## 推荐理由

这篇不是纯理论，有具体机制和实测数字，对搞推理加速的人是真干货。但内容偏底层 CUDA 优化，一般读者上手门槛高，所以推荐度上我稍微收了一点，整体还是值得放进精选。

## 锐评

这篇论文的核心思路很直白：在 GQA 基础上加一个轻量的“索引分支”，先给每块 KV 缓存打分，每个查询组只挑分数最高的几块，主分支再对挑出来的块做精确注意力计算。相当于先快速扫一眼目录，只精读最相关的章节，省掉了大量无用计算。配合专门写的 GPU 内核，一个 109B 参数的多模态模型在 H800 上跑 1M 上下文，预填充端到端快了 14.2 倍，解码快了 7.6 倍，而且质量跟全量 GQA 持平。

数字看着漂亮，但要注意几点。第一，测试是在 H800 上跑的，家用显卡能不能复现这个加速比还不清楚，论文没给消费级硬件的 benchmark。第二，109B 模型本身就不小，即使推理加速了，显存门槛依然很高，Reddit 原帖也在问能不能在家用卡上跑，目前没有答案。第三，代码和推理内核开源了，但模型权重是否公开正文没披露，想自己试还得等消息。

整体来说，这个方法对做超长上下文推理服务的人是个实打实的优化方向，省算力还不掉效果。但对想在自己机器上玩的个人开发者，先别太激动，等权重放出来、有人测了消费级显卡再说。
