Epoch AI 和 METR 搞了个新基准 MirrorCode,看 AI 能不能独立重写一整个软件项目
What's the largest software project AI can complete on its own?
MirrorCode 让 AI 不看源码,从零复刻 25 个完整程序,要求输出和原版在端到端测试里完全一致。任务覆盖了 Unix 工具、数据序列化、生物信息、解释器、静态分析、加密和压缩。和现有基准最大的区别是,它给了真实的推理预算:最贵的一次跑了 2600 美元,AI 连续干了 19 天没人插手。Epoch AI 估算,最难的任务换人类工程师不用 A...
推荐理由:MirrorCode 这个基准的核心是让 AI 不看源码、从零复刻 25 个程序,且输出必须通过端到端测试。它跟以往刷榜最大的区别在于给了真实推理预算——最贵一次 2600 美元、连续跑 19 天,而不是按固定 token 数掐断。任务从 Unix 工具到加密压缩都覆盖了,Epoch AI 还拿人类工程师做对比,让“AI 能独立做多大项目”这个问题有了一个可量化的答案。我会先打个折:正文没披露具体成功率或各任务得分分布,所以只能看到上限在哪,看不到稳定性如何。但光这个上限本身,对正在考虑让 AI 进开发流程的团队来说,已经是个很实在的参考点。