跳到正文
热点事件历史事件

METR 对 Claude Opus 5.5 做了部署前评估,认为它比上一代有进步,但离全自动搞研发还差得远

1 篇报道1 个报道来源6 天前更新

先了解这件事

事实说明

METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点,在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务,以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升,但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...

报道时间线

沿着报道,了解事件的不同侧面。

9月22日
  1. AI HOT 精选精选
    METR 对 Claude Opus 5.5 做了部署前评估,认为它比上一代有进步,但离全自动搞研发还差得远

    METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点,在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务,以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升,但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...