# Cursor 发布 Composer 2.5，用文字反馈教模型改掉坏习惯，合成数据规模翻了 25 倍

> 原标题：Composer 2.5 发布与技术解析

- 来源：AI HOT 精选
- 发布时间：2026-05-18T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23575
- 原文：https://cursor.com/blog/composer-2-5

## 摘要

Cursor 把代码助手 Composer 升级到了 2.5 版，底层还是基于月之暗面的 Kimi K2.5 开源模型。这次主要做了三件事：一是用“文字反馈强化学习”，在模型犯错的地方直接插一句提示（比如“提醒：可用工具有这些”），让模型在那个点上学会纠正，而不是靠最后的总分去猜哪里做错了；二是把合成训练数据的量提到了上一代的 25 倍，并且动态生成更...

## 推荐理由

HKR 三项都踩中了：Cursor 本身就是编程助手的核心入口，文章又给了 Moonshot 基座、25 倍合成数据、文本反馈 RL 和分片 Muon 这些实打实的训练细节。我会先打个折——正文没给基准测试、没提价格，也没说用户端能力边界，所以分数卡在 78–84 这个区间是合理的。

## 锐评

这次 Composer 2.5 的核心变化不是换了个更强的底座模型，而是改了训练方法。他们用了一种叫“文字反馈强化学习”的方式：模型在生成代码的过程中一旦犯错，训练系统会直接在出错的位置插入一句提示，比如“提醒：可用的工具有这些”，让模型在那个点上学会纠正。这比传统方法聪明——以前是看整段输出的最终得分，模型得自己猜哪里做错了，信号很模糊。Cursor 说这能改善长任务里的持续工作能力和指令遵循度，还顺带调了模型的沟通风格和“努力程度”，但这些行为指标没有公开的基准测试可以验证，只能靠用户自己感受。

另一个值得注意的点是合成训练数据量提到了上一代的 25 倍，并且是从真实代码库里动态生成的。这解释了为什么他们敢说模型更“聪明”了——数据规模上去了，覆盖的场景更复杂。但正文没披露具体用了哪些代码库、数据质量怎么控制，也没说这种规模扩张对训练成本的影响有多大。

他们还提到正和 SpaceXAI 一起从头训练一个更大的模型，算力是这次的 10 倍，用了百万张 H100 等效卡。这是个远期饼，现在能用的还是基于 Kimi K2.5 微调出来的版本。如果你期待的是模型架构层面的突破，这次更新可能会让你觉得不够过瘾；但如果你关心的是代码助手在实际项目里能不能少犯低级错误、更听话，这个“当场纠错”的思路值得关注。
