# METR 对 Claude Opus 5.5 做了部署前评估，认为它比上一代有进步，但离全自动搞研发还差得远

> 原标题：METR 发布 Claude Opus 5.5 部署前评估摘要

- 来源：AI HOT 精选
- 发布时间：2026-09-21T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58432
- 原文：https://metr.org/blog/2026-09-22-claude-opus-5-5

## 摘要

METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点，在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务，以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升，但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...

## 推荐理由

METR 的部署前评估是第三方独立视角，给了具体任务对比，结论是 Opus 5.5 有进步但不是飞跃，信息量够从业者判断。没打更高分是因为发现本身是“渐进提升”，冲击力有限，但作为安全与能力交叉的评估，对 Anthropic 模型来说参考价值不低。

## 锐评

METR 这份评估最值得看的是他们没把话说满。Claude Opus 5.5 在几个长周期任务上确实比 Fable 5.1 有进步，比如预算版 NanoGPT 速通赛和游戏机器人这类结果可验证的任务，以及 LMCA 概念推理和 Sunlight 开放研究这类难验证的任务，但提升幅度是“温和的”，不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势，没有突然跳档。

另一个有意思的点是 METR 内部另一个团队给了一份更敏感的评估，说 AI 已经把 Anthropic 的整体研发速度拉快了约 1.5 倍，有 30% 的概率达到 2 倍。但这个结论的支撑证据和推理细节因为访问权限不同，写这份摘要的团队自己也没看到，所以只能当个参考，不能直接拿来论证。

目前缺的信息还不少：模型参数量、具体定价、发布时间表都没披露。另外，METR 明确说这次评估只聚焦 AI 研发能力，不涉及对齐和安全属性，所以别把这份摘要当成全面体检报告。
