# Claude Sonnet 5.5 在 AA 智能指数排到第二，靠的是每次任务狂吐近 20 万 token

> 原标题：Claude Sonnet 5.5 达到 Artificial Analysis 智能指数第 2 名

- 来源：AI HOT 精选
- 发布时间：2026-09-27T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59514
- 原文：https://artificialanalysis.ai/articles/claude-sonnet-5-5

## 摘要

Anthropic 发了 Claude Sonnet 5.5，在 Artificial Analysis 的智能指数上拿了 56 分，比顶配 Opus 5.5 只低 2 分。价格没涨，还是每百万 token 输入 2 美元、输出 10 美元，但实际跑一次任务要花大约 7.6 美元，比 Sonnet 5 贵了五成，因为它开足马力时平均每次任务会输出约 1...

## 推荐理由

Anthropic 发了 Sonnet 5.5，Artificial Analysis 给了实打实的跑分：智能指数 56 分排第二，Terminal-Bench 4.0 正确率 64% 追平自家旗舰和 GPT-6 Astra，但单次任务实际开销约 7.6 美元，比 Sonnet 5 贵了 50%。三个维度都踩中了：性能逼近顶配但价格没涨造成的张力，有具体分数和成本可以横向对比，以及让用 Claude 搭 agent 的人不得不重新算性价比。

## 锐评

Claude Sonnet 5.5 在 Artificial Analysis 的智能指数上拿了 56 分，只比顶配 Opus 5.5 低 2 分，价格也没涨，输入每百万 token 2 美元、输出 10 美元。但别急着觉得划算——它开足马力时平均每次任务要吐出约 19.3 万个 token，比 Opus 5.5 还多六成，是 GPT-6 Astra 的七倍，导致实际跑一次任务要花大约 7.6 美元，比上一代 Sonnet 5 贵了 50%。

它在终端操作和知识工作上确实追平了 Opus 5.5，比如 Terminal-Bench 4.0 拿了 64%，比 Opus 5.5 还高 4 个百分点。但短板也很明显：事实知识准确率只有 54%，比 Opus 5.5 低了 12 个百分点，科学推理也差一截。好消息是它的幻觉率更低，47% 对 59%。

需要留意的是，这些评测跑的是预发布版本，当时有个结构化输出的 bug，Anthropic 说正式版已修复，性能至少不会更差。但正文没披露修复后的复测结果，这点先别太激动。另外，它上下文窗口还是 100 万 token，支持图文输入，这点没变。
