# Epoch AI 和 METR 搞了个新基准 MirrorCode，看 AI 能不能独立重写一整个软件项目

> 原标题：What's the largest software project AI can complete on its own?

- 来源：Hacker News 首页
- 发布时间：2026-08-03T16:16:40.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48472
- 原文：https://epoch.ai/MirrorCode

## 摘要

MirrorCode 让 AI 不看源码，从零复刻 25 个完整程序，要求输出和原版在端到端测试里完全一致。任务覆盖了 Unix 工具、数据序列化、生物信息、解释器、静态分析、加密和压缩。和现有基准最大的区别是，它给了真实的推理预算：最贵的一次跑了 2600 美元，AI 连续干了 19 天没人插手。Epoch AI 估算，最难的任务换人类工程师不用 A...

## 推荐理由

MirrorCode 这个基准的核心是让 AI 不看源码、从零复刻 25 个程序，且输出必须通过端到端测试。它跟以往刷榜最大的区别在于给了真实推理预算——最贵一次 2600 美元、连续跑 19 天，而不是按固定 token 数掐断。任务从 Unix 工具到加密压缩都覆盖了，Epoch AI 还拿人类工程师做对比，让“AI 能独立做多大项目”这个问题有了一个可量化的答案。我会先打个折：正文没披露具体成功率或各任务得分分布，所以只能看到上限在哪，看不到稳定性如何。但光这个上限本身，对正在考虑让 AI 进开发流程的团队来说，已经是个很实在的参考点。

## 锐评

MirrorCode 这个基准的设计思路挺直接：给 AI 一个程序的功能描述和输入输出样例，让它从零写出一个能通过端到端测试的复刻版，全程不能偷看原始代码。任务不是刷题那种小函数，而是完整的 Unix 工具、数据序列化库、生物信息软件、解释器、静态分析器、加密和压缩程序。这比现有大多数代码基准更接近“AI 能不能独立干一个软件项目”这个问题。

有两个数字值得留意。一是推理预算给得很足，最贵的一次任务花了 2600 美元，AI 连续跑了 19 天没人插手。Epoch AI 估算最难的任务换人类工程师不用 AI 辅助也要几个月。这说明他们想测的是上限，不是抠成本。二是他们声称基准天然防作弊，但正文没展开讲具体机制，这点先别太激动，得等论文或技术报告出来再看。

目前最大的信息缺口是成绩。文章只介绍了任务设计和成本上限，没披露任何模型的实际完成率或得分。不知道顶尖模型能做到什么程度，就没法判断这个基准是在测当前能力边界，还是在给未来留余量。另外，2600 美元一次测试对大多数团队来说门槛不低，后续能不能有更轻量的版本也值得关注。
