# Anthropic 发布 Claude Sonnet 5，性能逼近更贵的 Opus 系列，部分测试反超

> 原标题：Anthropic 发布 Claude Sonnet 5，号称最智能体版本，逼近 Opus 系列

- 来源：AI HOT 精选
- 发布时间：2026-06-30T18:46:10.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41512
- 原文：https://the-decoder.com/anthropics-new-claude-sonnet-5-closes-the-gap-to-the-pricier-opus-model-series

## 摘要

Anthropic 推出了新模型 Claude Sonnet 5，官方说这是目前最会自主干活的 Sonnet 版本——它能自己定计划、调用浏览器和终端这类工具。跑分全面超过上一代 Sonnet 4.6，在真实世界知识工作测试 GDPval-AA v2 上拿了 1618 分，比更贵的 Opus 4.8 还高出 3 分。不过，在智能体编程测试 SWE-be...

## 推荐理由

Anthropic 发了 Claude Sonnet 5，官方定位是 Sonnet 系列里最会自主干活的版本，能自己定计划、调浏览器和终端。跑分全面超过上一代 Sonnet 4.6，在 GDPval-AA v2 上拿了 1618 分，比更贵的 Opus 4.8 还高 3 分，这点挺有意思——中杯在知识工作测试里干翻了大杯。不过正文没披露 SWE-bench 智能体编程分数和定价，这两个数会决定它到底值不值得切过去。我会先打个折：如果价格没涨太多，日常用 Sonnet 的人可以直接换；如果涨价明显，就得等编程实测出来再判断。

## 锐评

Anthropic 这次把 Sonnet 5 定位成“最能自主干活的 Sonnet”，核心卖点是它能自己定计划、调用浏览器和终端，不用人一步步盯着。从跑分看，它确实全面超过了上一代 Sonnet 4.6，在模拟真实知识工作的 GDPval-AA v2 测试里拿了 1618 分，比更贵的 Opus 4.8 还高出 3 分。这个反超挺有意思，说明在部分实际任务上，小模型也能摸到大模型的后背。

不过，在更硬核的编程测试 SWE-bench Pro 上，Sonnet 5 的 63.2% 离 Opus 4.8 的 69.2% 还有明显差距。所以如果你主要用它写代码，别指望它能完全替代 Opus。另外，Anthropic 特意强调这次没拿网络安全任务训练模型，在漏洞利用测试上分数远低于被禁用的 Mythos 5 和 Fable 5，实时安全防护默认开启。这算是给监管和用户吃定心丸。

价格方面，现在到 2026 年 8 月是尝鲜价，之后涨回标准 Sonnet 费率。正文没披露具体降价幅度，也没说标准费率是多少，想算账的人还得再等等。
