跳到正文
新智元 · 公众号

Claude Opus 4.8 实测:高级工程师基准冲到 63 分,但高强度任务掉到 42 分,Max 用户几小时就撞速率墙

Claude Opus 4.8实测封神!强到离谱,也贵到肉痛

这篇来自新智元的实测文章目前页面被微信环境验证挡住了,正文内容没抓到。从标题和摘要信息看,Claude Opus 4.8 在 Extra-High 级别的高级工程师基准测试里拿了 63 分,比上一代 Opus 4.7 高出 30 分,这个涨幅挺夸张。但切换到 High 强度任务时分数掉到 42 分,说明模型在持续高压场景下稳定性还有问题。另外,每月 2...

推荐理由:Anthropic/Claude 相关度天然高,加上有实测跑分和配额吐槽,HKR 三项都站得住。钩子是强但贵且 High 档拉胯,K 有基准分和额度细节,R 直接戳中 Agent 场景下的成本焦虑。来源是媒体评测而非官方公告,所以定在 P1 低位。

读原文 ↗导出 Markdown