跳到正文
Hacker News 首页

Cognition 发布 SWE-2:编程跑分追上第一梯队,但长链条任务还差一截

Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1

SWE-2 是 Cognition 在 Kimi K3 基座上用强化学习(RL)做后训练得到的编程模型,总参数量 2.8 万亿,每次推理激活 1040 亿参数。它在 Terminal-Bench 2.1 上拿了 92.8 分,是目前公开榜单里最高的;FrontierCode 1.1 Main 跑出 50.0 分,比 Claude Fable 5.1 低...

推荐理由:SWE-2 在 Terminal-Bench 2.1 上拿了 92.8 分,是目前公开最高分,甩开第二名近一倍,这个数字本身够硬。不过正文只给了模型参数和基座信息,没提训练成本、数据细节和实际部署表现,所以分数先收下,但别急着把它当成全面领先的证据。

读原文 ↗导出 Markdown