跳到正文
机器之心 · 公众号

阿里 RTPurboV2:用几百步训练把注意力计算砍掉九成,原生 Transformer 又硬气了一回

阿里RTPurboV2:原生Transformer再次崛起,百步训练实现10倍稀疏注意

阿里 RTP 团队发了 RTPurboV2,思路很直接:把模型里 85% 的注意力头换成滑动窗口注意力(SWA),剩下 15% 负责长距离检索的头用低秩投影、聚类和动态 top-p 压缩。适配训练只要大概 600 步、约 100 万条标注 token,Prefill 阶段推理加速最高到 9.36 倍。不过正文因为环境验证失败没抓到具体实验细节和模型规模...

推荐理由:阿里 RTP 团队这篇 RTPurboV2 思路很直白:把模型里大部分注意力头换成便宜的滑动窗口,只留一小撮头用低秩投影和聚类做长距离检索,训练成本压到 600 步、100 万条 token,Prefill 加速最高能到 9.36 倍。这个数字我会先打个折,因为正文自己说环境验证失败没抓到实验细节和模型规模,所以加速比在什么尺寸、什么长度下测的还不清楚。但思路本身对做长上下文部署的人有参考价值,属于工程信号强但缺完整验证的那种。

读原文 ↗导出 Markdown