# Claude Opus 4.7 上线两天口碑翻车：跑分登顶，推理测试却暴跌

> 原标题：跑分第一，推理暴跌！Claude Opus 4.7上线48小时口碑崩了

- 来源：新智元 · 公众号
- 发布时间：2026-04-18T10:15:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6625
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652693267&idx=2&sn=1c1057254e1158138b97be7bc4593914

## 摘要

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一，但换到 NYT Connections Extended 这个推理测试，准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外，新模型换了一套分词器，同一段文本消耗的 to...

## 推荐理由

这条信息的价值不在“口碑崩了”的标题，而在于它把四个具体变化摆了出来：基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说，这比单纯报一个模型发布更有参考意义，因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析，不是 Anthropic 官方首发，所以重要性给到 83、放在 featured 层级是合理的。

## 锐评

这条新闻最值得看的是分数打架：综合评分 57 并列第一，但 NYT Connections Extended 推理准确率从上一代 4.6 的 94.7% 直接掉到 41.0%，这不是微调翻车，是能力断崖。Anthropic 自己引用的 Elo 分 1753 比第二名高 79 分，但那个榜单测的是偏好投票，不是硬推理。我会先打个折——偏好分高可能说明模型更会说人话，不代表更会解题。

另一个坑在成本。新模型换了分词器，同一段文本 token 消耗变成原来的 1 到 1.35 倍，按 token 计费的话等于变相涨价。老版本用 thinking 参数的请求还可能直接报 400 错误，迁移不是无缝的。正文没披露具体定价变化，也没说这个推理暴跌是 prompt 不适配还是模型本身退化，这两点才是决定要不要切过去的关键。

对团队来说，现在升级 Opus 4.7 更像在做取舍：要综合跑分好看还是推理稳定，要新能力还是老管线兼容。建议先拿自己的业务 prompt 跑一遍，别只看排行榜。
