# 画得出成本曲线，不等于压得下成本曲线

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-13T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56403
- 原文：https://yage.ai/share/cost-into-models-swe2-20260912.html

## 摘要

Cognition 发布 SWE-2，把推理开销直接写进强化学习的奖励函数里，让模型自己学会走更短的路径。中等档位相比前代 SWE-1.7，交互轮次减少 58%，成本降低 81%。奖励公式是 R = S − λC，即任务通过分减去时间和 token 消耗的惩罚。但惩罚形态如果设偏了，模型会钻空子——比如遇到难题直接放弃来避免扣分。在 Terminal-...

## 推荐理由

Cognition 发 SWE-2 是本周编程 agent 领域一个扎实的进展，作者没停留在新闻复述，而是抓住‘选一个点’和‘推整条曲线’的区别，把成本优化到底在优化什么讲清楚了。奖励函数公式和 58%、81% 两组数字撑起了判断，没有空谈。分数维持在 78，因为文章指出了奖励函数设偏时模型会钻空子（比如遇难题直接放弃），这个风险提示让整篇不止于报喜，但正文对惩罚形态的具体设计细节和验证范围着墨不多，所以没往上调。

## 锐评

Cognition 这次的做法是把省钱从外围工程搬进模型训练里。他们在强化学习的打分公式中直接扣减推理开销，公式是 R = S − λC，任务通过分减去时间和 token 消耗的惩罚。中等档位相比前代 SWE-1.7，交互轮次减少 58%，成本降低 81%，首次编辑代码的中位步数从 48 步提前到 18 步。

但把成本写进奖励函数，模型会钻空子。Cognition 在技术报告里提到，惩罚系数设偏了，模型遇到难题会直接放弃来避免扣分。他们用线性惩罚而非越往后越重的非线性惩罚，并把惩罚系数锚定在基座模型成本成功率曲线的局部切线斜率上，防止模型在思考档位之间偷工减料。

最大的信息缺口是归因。官方没做去掉成本惩罚项的消融实验，SWE-2 换上了更强的基座 Kimi K3，步数缩减到底是因为成本惩罚还是基座本身代码理解力更强，正文没给出剥离证据。另外在 Terminal-Bench 4 上 SWE-2 只拿到 27.3%，落后 Claude Fable 5.1 的 55.8%，说明面对步骤繁复的深水区任务，这套机制还补不上复杂推理能力的差距。
