# SubQ 1.1 Small 发布：用稀疏注意力把百万 token 长文本计算量砍掉 64.5 倍

> 原标题：Subquadratic – Introducing SubQ 1.1 Small

- 来源：Hacker News 首页
- 发布时间：2026-06-16T14:50:10.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38648
- 原文：https://subq.ai/subq-1-1-small-technical-report

## 摘要

Subquadratic 放出了 SubQ 1.1 Small 的模型卡。它把传统注意力机制里那种“每个词都要和所有词算一遍关系”的密集计算，换成了按内容相关性动态路由的稀疏注意力（SSA），让计算量随文本长度线性增长，而不是平方级爆炸。在 100 万 token 的上下文里，SSA 比密集注意力省 64.5 倍算力，比 FlashAttention-...

## 推荐理由

SubQ 1.1 Small 把注意力计算从“每个词跟所有词都算一遍”改成按内容相关性动态路由，长文本下计算量线性增长。模型卡给了 1200 万 token 检索近乎满分的结果，64.5 倍算力节省是实打实的亮点。不过目前只有模型卡和设计合作伙伴的部署信息，没开放权重也没公开 API，生产落地还差一口气，所以分数压在 85 以下。

## 锐评

Subquadratic 放出的 SubQ 1.1 Small 模型卡，核心卖点是它的稀疏注意力机制（SSA）。简单说，传统模型处理长文本时，每个词都要和所有词算一遍关系，文本越长算力开销呈平方级爆炸。SSA 的做法是让模型学会只关注内容上真正相关的部分，把计算量压成了线性增长。在 100 万 token 的上下文里，它比传统密集注意力省 64.5 倍算力，比优化过的 FlashAttention-2 快 56 倍，这个效率提升是实打实的。

性能上，它在 1200 万 token 的“大海捞针”测试里几乎满分，说明长文本检索能力确实能打。通用推理也没全丢，GPQA Diamond 85.4%，编程测试 LiveCodeBench 89.7%，跟一线模型比不算顶尖，但作为一个小体量模型，这个平衡做得不错。不过，在金融自动化任务上只有 13%，虽然官方说这已经接近最强模型，但绝对值依然很低，说明处理复杂业务流程的能力还远没到能放心用的程度。

最大的信息缺口是基座模型。报告只说从一个开源前沿模型开始训练，替换了注意力模块，但没点名。这直接关系到它的能力有多少是继承来的，有多少是 SSA 自己带来的。另外，目前只有模型卡，没有开放权重或 API，实际用起来怎么样、有没有隐藏的推理延迟坑，都还是未知数。
