SubQ 1.1 Small 发布:用稀疏注意力把百万 token 长文本计算量砍掉 64.5 倍
Subquadratic 放出了 SubQ 1.1 Small 的模型卡。它把传统注意力机制里那种“每个词都要和所有词算一遍关系”的密集计算,换成了按内容相关性动态路由的稀疏注意力(SSA),让计算量随文本长度线性增长,而不是平方级爆炸。在 100 万 token 的上下文里,SSA 比密集注意力省 64.5 倍算力,比 FlashAttention-...
推荐理由:SubQ 1.1 Small 把注意力计算从“每个词跟所有词都算一遍”改成按内容相关性动态路由,长文本下计算量线性增长。模型卡给了 1200 万 token 检索近乎满分的结果,64.5 倍算力节省是实打实的亮点。不过目前只有模型卡和设计合作伙伴的部署信息,没开放权重也没公开 API,生产落地还差一口气,所以分数压在 85 以下。