# RTPurbo：用几百步训练把全注意力模型转成稀疏推理，长上下文预填充快 9.36 倍

> 原标题：Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps

- 来源：r/LocalLLaMA
- 发布时间：2026-05-25T15:03:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27021
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tnbskt/full_attention_strikes_back_transferring_full/

## 摘要

这篇论文提出 RTPurbo，能把原本用全注意力的模型改成稀疏注意力来跑推理，而且只需要几百步训练。做法是只给“检索头”保留完整的 KV 缓存，其他头用一个 16 维的 token 索引器来近似，相当于大幅压缩了要存要算的内容。在 100 万 token 的长上下文场景下，预填充阶段最高快了 9.36 倍，解码阶段快了约 2.01 倍。正文没披露具体用...

## 推荐理由

我会先打个折：目前只有 Reddit 讨论，正文没披露模型规模、具体任务和代码，验证强度偏弱。但“几百步把全注意力转稀疏”这个思路本身挺省钱的，数字也够具体，对做长上下文推理优化的人值得看一眼。信息缺口明显，所以分数没往上拉。

## 锐评

这篇论文的思路挺直接：不是所有注意力头都需要记住全部历史，只有少数“检索头”在长上下文里真正干活。RTPurbo 的做法就是只给这些头保留完整的 KV 缓存，其余头用一个 16 维的 token 索引器来近似，相当于把要存要算的内容大幅压缩。结果在 100 万 token 的场景下，预填充阶段最高快了 9.36 倍，解码阶段快了约 2.01 倍，而且只需要几百步训练就能把全注意力模型转过来。

不过现在能看到的只有 Reddit 上的讨论和 Bloomberg 的标题，原文被网络屏蔽了，没法确认具体在哪些模型和基准上测的。46 个赞和 45 条评论说明社区关注度不低，但讨论里也没挖出更多定价或开源细节。

还缺两块：一是这个方法在不同架构、不同规模模型上的泛化表现，二是稀疏化之后长文本推理的质量到底掉了多少，光看速度不够。另外，几百步训练的成本如果本身就不低，那对个人开发者来说门槛还在。
