# Cursor 发布 CursorBench 3.1，用真实用户的多文件编程任务给代码智能体打分

> 原标题：CursorBench 3.1

- 来源：Hacker News 首页
- 发布时间：2026-07-02T05:19:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41901
- 原文：https://cursor.com/evals

## 摘要

Cursor 新出的这个评测基准，题目不是人造的，而是直接从真实用户会话里扒出来的——需求模糊、要改多个文件的那种。3.1 版还加了理解代码库、找 bug、做计划和代码审查这几类题。目前榜首是 Fable 5 Max，得分 72.9%，但每跑一个任务平均要花 18 美元、用掉 6.3 万个 token、执行 76 步，成本不低。GPT-5.5 High...

## 推荐理由

Cursor 把基准从人造题换成了真实用户会话，3.1 版还加了读代码库、找 bug、做计划这些题型，更贴近日常开发。Fable 5 Max 目前得分最高 72.9%，但跑一次任务平均花 18 美元、烧 6.3 万个 token、执行 76 步，成本不低。GPT-5.5 High 得分 64.3%，正文没给它的具体花费，这点先别急着比。整体信息量够从业者直接做选型参考，但没披露样本量和任务难度分布，验证强度要打个折。

## 锐评

Cursor 这次发布的 CursorBench 3.1 挺实在，题目不是人造的，直接从真实用户会话里扒出来的——需求模糊、要改多个文件的那种。3.1 版还加了理解代码库、找 bug、做计划和代码审查这几类题，比纯改代码更贴近实际工作。

榜首 Fable 5 Max 得分 72.9%，但每跑一个任务平均要花 18 美元、用掉 6.3 万个 token、执行 76 步，成本不低。反观 GPT-5.5 High，得分 62.6%，只差 10 个百分点，但每次只要 3.59 美元，性价比高出一大截。最省的是 Composer 2.5，63.2% 的得分只要 0.55 美元一次。

不过正文没披露总共有多少道题，也没说评分具体怎么打的。分数之间差一两个百分点，可能只是统计波动，别太当真。另外这些成本是按官方标价算的，实际用起来可能还有折扣。
