Cursor 评估负责人说 Claude Fable 5 在他们最难的那 1% 编程题里拿了 72.9%
Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高
Cursor 的评估负责人 Nate Schmidt 在 Anthropic 博客里讲了他们怎么判断 Claude Fable 5 能打。核心数字是 CursorBench 上 72.9% 的得分,比上一代跳了一大截。这个测试不是刷通用榜,专挑那些连真人都头疼的长尾编程问题。不过正文没公布上一代的基线分、测试集大小和具体题目,所以 72.9% 只能当个...
推荐理由:Cursor 的评估负责人跑到 Anthropic 博客上发文章,本身就是一个信号。72.9% 的 CursorBench 分数是实打实的数字,而且测试设计针对的是连真人都头疼的长尾编程问题,不是那种刷分的通用榜。我会先打个折:正文没披露上一代的基线分、测试集大小和具体题目,所以这个 72.9% 只能当个相对进步的参考,不能直接换算成绝对能力。但考虑到是第一手工程评估,对日常重度依赖 Cursor 的开发者来说,这条信息比一般的模型发布博文更有实际意义,给 82 分合理。