AI 用 14 小时复现人类数周编程任务,机器人叠衣服成功率 99.1%
Import AI 466: The bitter lesson for robotics, AIs complete week-long programming tasks; and OpenAI’s accidental AI hacker
Epoch 和 METR 的 MirrorCode 基准测试显示,Claude Opus 4.7 在 14 小时内、花 251 美元推理成本,重新实现了一个人类需要 2 到 17 周才能完成的软件项目。测试方式是只给模型命令行交互权限,不让看源码也不让上网,让它从零写出功能一样的程序。25 个目标程序里有 17 个至少有一次满分复现,但 ruff 这类...
推荐理由:MirrorCode 是 Epoch 和 METR 搞的一个长周期编程基准,Claude Opus 4.7 用 14 小时复现人类数周的工作,数字和失败案例都摆出来了。HKR 三条全中,但这是 newsletter 摘要不是原论文,而且任务复杂度高,我会先打个折——信息密度够,但别当完整评测报告看。