# 阿里 RTPurboV2：用几百步训练把注意力计算砍掉九成，原生 Transformer 又硬气了一回

> 原标题：阿里RTPurboV2：原生Transformer再次崛起，百步训练实现10倍稀疏注意

- 来源：机器之心 · 公众号
- 发布时间：2026-06-08T02:07:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/36573
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651037653&idx=1&sn=9a9352fb7a5ce8b8e51baea10016f3fa

## 摘要

阿里 RTP 团队发了 RTPurboV2，思路很直接：把模型里 85% 的注意力头换成滑动窗口注意力（SWA），剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token，Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

## 推荐理由

阿里 RTP 团队这篇 RTPurboV2 思路很直白：把模型里大部分注意力头换成便宜的滑动窗口，只留一小撮头用低秩投影和聚类做长距离检索，训练成本压到 600 步、100 万条 token，Prefill 加速最高能到 9.36 倍。这个数字我会先打个折，因为正文自己说环境验证失败没抓到实验细节和模型规模，所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值，属于工程信号强但缺完整验证的那种。

## 锐评

RTPurboV2的思路很直接：把Transformer里大部分注意力头改成只看局部上下文的滑动窗口注意力，只留15%的头负责跨长距离抓关键信息。这些检索头用低秩投影压缩、聚类和动态top-p来降低计算量。适配训练成本很低，大概600步、100万条标注token就能完成，不需要从头训大模型。Prefill阶段推理加速最高到9.36倍，对长文本场景省算力挺明显。

但这条消息有个硬伤：原文因为微信环境验证失败，实际没抓到完整实验部分。模型规模多大、在哪些基准上测的、精度损失多少、跟其他稀疏注意力方案对比如何，这些关键信息都缺失。9.36倍是峰值还是平均也没说清。

如果数据属实，这个方案对已有模型做推理加速的门槛确实低，几百步适配就能用。但没看到精度对比之前，只能说思路干净，落地效果还得等完整论文或开源代码放出来再判断。
