# Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%

> 原标题：Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

- 来源：AI HOT 精选
- 发布时间：2026-07-17T16:32:51.023Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44970
- 原文：https://claude.com/blog/working-at-the-frontier-cursor

## 摘要

Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分，比上一代跳了一大截。这个测试不是刷通用榜，专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目，所以 72.9% 只能当个...

## 推荐理由

Cursor 的评估负责人跑到 Anthropic 博客上发文章，本身就是一个信号。72.9% 的 CursorBench 分数是实打实的数字，而且测试设计针对的是连真人都头疼的长尾编程问题，不是那种刷分的通用榜。我会先打个折：正文没披露上一代的基线分、测试集大小和具体题目，所以这个 72.9% 只能当个相对进步的参考，不能直接换算成绝对能力。但考虑到是第一手工程评估，对日常重度依赖 Cursor 的开发者来说，这条信息比一般的模型发布博文更有实际意义，给 82 分合理。

## 锐评

Cursor 的评估负责人亲自下场写博客，这事本身就值得看一眼——工具方直接告诉你他们怎么判断模型能不能打，比看通用跑分实在。他们用的 CursorBench 专挑那种连真人都头疼的长尾编程问题，不是刷题榜，所以 72.9% 这个数含金量比普通基准高。

但信息缺口也很明显。正文没公布上一代模型的基线分，也没说测试集到底有多少道题、具体长什么样。没有基线，这个“跳了一大截”就没办法量化——是 10 个点还是 30 个点，差别很大。另外，测试集如果太小，分数波动会很大；题目如果偏重某种语言或场景，结论也不通用。

我的判断是：这个数字说明 Claude Fable 5 在 Cursor 的真实工作流里确实变强了，方向可信。但如果你要拿它做采购决策，最好等 Cursor 公开更多细节，或者自己拿内部项目跑一遍。毕竟工具方测自己用的模型，天然有利益关系，数字会挑好看的放。
