跳到正文
新智元 · 公众号

Claude Opus 4.7 上线两天口碑翻车:跑分登顶,推理测试却暴跌

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

Anthropic 新模型 Claude Opus 4.7 上线不到 48 小时就吵翻了。在 Artificial Analysis 综合评分上它拿了 57 分并列第一,但换到 NYT Connections Extended 这个推理测试,准确率直接从上一代 4.6 的 94.7% 掉到 41.0%。另外,新模型换了一套分词器,同一段文本消耗的 to...

推荐理由:这条信息的价值不在“口碑崩了”的标题,而在于它把四个具体变化摆了出来:基准跑分领先、推理任务大幅退步、token 消耗变高、API 参数不兼容。对从业者来说,这比单纯报一个模型发布更有参考意义,因为它提示了升级可能带来的隐性成本。不过文章本身是发布 48 小时后的二次分析,不是 Anthropic 官方首发,所以重要性给到 83、放在 featured 层级是合理的。

读原文 ↗导出 Markdown