# Cognition 发布 SWE-2 编码模型，跑分逼近前沿但成本砍掉六成多

> 原标题：Cognition 发布 SWE-2 编码模型，以更低成本逼近前沿

- 来源：AI HOT 精选
- 发布时间：2026-09-09T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56155
- 原文：https://cognition.com/blog/swe-2

## 摘要

Cognition 推出了新模型 SWE-2，在 FrontierCode 1.1 Main 上拿到 50.0% 的分数，比自家上一代 SWE-1.7 高出 8 个百分点，同时成本比对手 Fable 5.1 低了 64%。它是在 2.8 万亿参数的 Kimi K3 基础上做强化学习后训练得到的，用的是一种单轮训练法，把不同思考深度的模式一起练出来。实际...

## 推荐理由

SWE-2 在 FrontierCode 1.1 Main 上跑到 50.0%，比前代涨了 8 个点，成本比 Fable 5.1 便宜 64%，是 Cognition 目前最接近前沿的一次。没给 85 分是因为它还是比 GPT-6 Astra 差几个点，而且基座用的是 Kimi K3 而不是自研模型。不过单轮 RL 训练法把不同思考深度揉在一起练，工程上省事，成本控制也漂亮，对想用第三方模型做编码 agent 的团队来说是个很实际的参考。

## 锐评

Cognition 这次拿出的 SWE-2 是个务实的升级：在 FrontierCode 1.1 Main 上拿到 50.0% 的分数，比自家上一代高了 8 个百分点，同时声称成本比对手 Fable 5.1 低了 64%。它是在 2.8 万亿参数的 Kimi K3 基础上做强化学习后训练得到的，用的是一种单轮训练法，把不同思考深度的模式一起练出来，让模型在“中等思考”档位就能用 53 步完成任务，而上一代要 127 步。

不过，这篇博客最大的信息缺口是没披露具体 API 调用价格。64% 的成本优势是基于内部测试的 token 消耗算出来的，实际用户花多少钱还不清楚。另外，在 Terminal-Bench 4 这个更难的基准上，SWE-2 只拿了 27.3%，被 Fable 5.1 的 55.8% 甩开一大截，说明它在复杂系统操作上还有明显短板。训练数据量翻了三倍、验证器靠自我对弈迭代硬化这些做法听起来靠谱，但缺乏消融实验来证明哪一步贡献最大。整体看，这是个在编码 agent 赛道上用更低成本逼近第一梯队的选手，但离全面领先还差一口气。
