# Claude Opus 4.8 实测：高级工程师基准冲到 63 分，但高强度任务掉到 42 分，Max 用户几小时就撞速率墙

> 原标题：Claude Opus 4.8实测封神！强到离谱，也贵到肉痛

- 来源：新智元 · 公众号
- 发布时间：2026-05-29T05:15:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30503
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652703717&idx=1&sn=bc5b99098d889cc32ee61d4dcfcf5f91

## 摘要

这篇来自新智元的实测文章目前页面被微信环境验证挡住了，正文内容没抓到。从标题和摘要信息看，Claude Opus 4.8 在 Extra-High 级别的高级工程师基准测试里拿了 63 分，比上一代 Opus 4.7 高出 30 分，这个涨幅挺夸张。但切换到 High 强度任务时分数掉到 42 分，说明模型在持续高压场景下稳定性还有问题。另外，每月 2...

## 推荐理由

Anthropic/Claude 相关度天然高，加上有实测跑分和配额吐槽，HKR 三项都站得住。钩子是强但贵且 High 档拉胯，K 有基准分和额度细节，R 直接戳中 Agent 场景下的成本焦虑。来源是媒体评测而非官方公告，所以定在 P1 低位。

## 锐评

这条消息最值得看的是两个数字：63 分和 42 分。Opus 4.8 在 Extra-High 级别的高级工程师基准上拿了 63 分，比 Opus 4.7 高出 30 分，涨幅确实夸张，说明模型在单次高难度推理任务上进步明显。但切换到 High 强度任务时分数掉到 42 分，差了 21 分，这个落差说明模型在持续高压场景下不够稳，可能跟资源分配或推理策略有关。

另一个关键信息是定价和实际体验的脱节。每月 200 美元的 Max 订阅用户反馈，跑复杂 agent 任务几小时内就撞速率限制，等于花了大价钱却用不爽。正文因为微信页面被验证挡住，没抓到具体测试方法和样本量，所以 63 分这个数字的含金量要打折——不知道是几道题、什么题型、有没有对比其他模型。

还缺的信息：Opus 4.8 在代码、长文本、多轮对话上的表现如何，以及 Anthropic 有没有调整推理成本结构。如果只是峰值高但日常用起来卡手，那这个"封神"更多是实验室里的神。
