# AI 用 14 小时复现人类数周编程任务，机器人叠衣服成功率 99.1%

> 原标题：Import AI 466: The bitter lesson for robotics, AIs complete week-long programming tasks; and OpenAI&#8217;s accidental AI hacker

- 来源：Import AI
- 发布时间：2026-07-27T13:30:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48373
- 原文：https://jack-clark.net/2026/07/27/import-ai-466-the-bitter-lesson-for-robotics-ais-complete-week-long-programming-tasks-and-openais-accidental-ai-hacker/

## 摘要

Epoch 和 METR 的 MirrorCode 基准测试显示，Claude Opus 4.7 在 14 小时内、花 251 美元推理成本，重新实现了一个人类需要 2 到 17 周才能完成的软件项目。测试方式是只给模型命令行交互权限，不让看源码也不让上网，让它从零写出功能一样的程序。25 个目标程序里有 17 个至少有一次满分复现，但 ruff 这类...

## 推荐理由

MirrorCode 是 Epoch 和 METR 搞的一个长周期编程基准，Claude Opus 4.7 用 14 小时复现人类数周的工作，数字和失败案例都摆出来了。HKR 三条全中，但这是 newsletter 摘要不是原论文，而且任务复杂度高，我会先打个折——信息密度够，但别当完整评测报告看。

## 锐评

这条新闻最值得看的是两个数字：14 小时和 251 美元。Epoch 和 METR 搞了个叫 MirrorCode 的测试，不让模型看源码、不让上网，只给命令行交互权限，让它从零写出功能一样的程序。Claude Opus 4.7 在 25 个目标程序里，有 17 个至少有一次满分复现，包括苹果开发的配置语言 pkl。但碰到 Python 代码检查工具 ruff 和数学包 giac_subset 就卡住了，8 个程序从未达到满分。这说明模型在长周期编程上进步很快，但碰到需要深度领域知识的项目还是会露馅。

机器人那边也是同一个故事。Anthropic 用同一款 Opus 4.7 模型，让机器狗自主完成取物任务，只用了 9 分 35 秒，比去年人类辅助下的记录快了 20 倍。机器人公司 Sunday 也验证了同样的路线：先大规模预训练，再用少量高质量数据微调，叠衣服成功率干到 99.1%。正文没披露这个 99.1% 是在什么环境下测的，真实家庭场景可能得打个折。

整体看，这两件事指向同一个趋势：通用模型能力往上走，编程和机器人这些下游任务就跟着水涨船高。但 MirrorCode 目前只测了 25 个程序，样本量偏小，还缺更多类型任务的验证。另外，模型在 ruff 这类项目上的失败原因正文没展开，是逻辑推理不够还是对 Python 生态理解不足，这点没说清楚。
