# Claude Opus 5.5 在编程智能体评测里拿了第一，但跑一次任务要花 13 美元

> 原标题：Artificial Analysis：Claude Opus 5.5 登顶 Coding Agent Index，但单任务成本升至 $13.04

- 来源：AI HOT 精选
- 发布时间：2026-09-24T01:24:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58500
- 原文：https://x.com/ArtificialAnlys/status/2102932119995756613

## 摘要

Artificial Analysis 把 Claude Opus 5.5 放在 Claude Code 的“最大出力”模式下跑了一遍 Coding Agent Index，得分 66，比上一代 Opus 5 的 60 分高出 6 分。三项子测试全线上涨：Terminal-Bench 4.0 正确率 63.1%，DeepSWE v1.1 正确率 68....

## 推荐理由

Claude Opus 5.5 在 Artificial Analysis 的 Coding Agent Index 上拿了 66 分，比 Opus 5 高出 6 分，三项子测试全线上涨，登顶没问题。但单任务成本 13.04 美元是硬数字，比上一代贵了不少。这是独立第三方用 Claude Code 的“最大出力”模式实测的结果，数据具体、来源可信，对实际用的人有直接参考意义。没给更高分是因为这只是单一基准测试，不代表整体能力。

## 锐评

Claude Opus 5.5 在 Coding Agent Index 上拿了 66 分，比上一代高了 6 分，三项子测试全线上涨，说明模型在终端操作、软件工程问答这些实际编程任务上确实更强了。但代价也很直接：单任务成本从 3 美元跳到 13.04 美元，翻了四倍多。

这个成本飙升跟测试设置有关——Artificial Analysis 用的是 Claude Code 的“最大出力”模式，相当于让模型反复尝试、调用更多工具来冲高分。正文没披露具体跑了多少轮、消耗了多少 token，所以没法判断这 13 美元里有多少是模型本身贵了，多少是“多试几次”堆出来的。

还缺一个对比：如果不用最大出力模式，Opus 5.5 的得分和成本会落在哪。另外，63% 到 68% 的正确率意味着还有三成多的任务做不对，实际落地时能不能靠重试把成功率拉到可用线，正文也没提。
