Cursor 发布 CursorBench 3.1,用真实用户的多文件编程任务给代码智能体打分
Cursor 新出的这个评测基准,题目不是人造的,而是直接从真实用户会话里扒出来的——需求模糊、要改多个文件的那种。3.1 版还加了理解代码库、找 bug、做计划和代码审查这几类题。目前榜首是 Fable 5 Max,得分 72.9%,但每跑一个任务平均要花 18 美元、用掉 6.3 万个 token、执行 76 步,成本不低。GPT-5.5 High...
推荐理由:Cursor 把基准从人造题换成了真实用户会话,3.1 版还加了读代码库、找 bug、做计划这些题型,更贴近日常开发。Fable 5 Max 目前得分最高 72.9%,但跑一次任务平均花 18 美元、烧 6.3 万个 token、执行 76 步,成本不低。GPT-5.5 High 得分 64.3%,正文没给它的具体花费,这点先别急着比。整体信息量够从业者直接做选型参考,但没披露样本量和任务难度分布,验证强度要打个折。