METR 对 Claude Opus 5.5 做了部署前评估,认为它比上一代有进步,但离全自动搞研发还差得远
METR 发布 Claude Opus 5.5 部署前评估摘要
METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点,在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务,以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升,但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...
推荐理由:METR 的部署前评估是第三方独立视角,给了具体任务对比,结论是 Opus 5.5 有进步但不是飞跃,信息量够从业者判断。没打更高分是因为发现本身是“渐进提升”,冲击力有限,但作为安全与能力交叉的评估,对 Anthropic 模型来说参考价值不低。