热点事件历史事件
METR 对 Claude Opus 5.5 做了部署前评估,认为它比上一代有进步,但离全自动搞研发还差得远
1 篇报道1 个报道来源6 天前更新
先了解这件事
事实说明
METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点,在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务,以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升,但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...
报道时间线
沿着报道,了解事件的不同侧面。
9月22日
- AI HOT 精选精选METR 对 Claude Opus 5.5 做了部署前评估,认为它比上一代有进步,但离全自动搞研发还差得远
METR 在模型发布前测了 Claude Opus 5.5 对 AI 研发的影响。结论是它比 Fable 5.1 强一点,在预算版 NanoGPT 速通赛、游戏机器人这类可验证任务,以及 LMCA 概念推理、Sunlight 开放研究这类难验证任务上都有提升,但不是断崖式飞跃。Anthropic 内部问卷也说它延续了 Mythos 级别的趋势。模型在需...