# Justin Cormack 用 35 万行 Rust 复盘：评估 AI Agent，先拿证据，别看覆盖率

> 原标题：Justin Cormack 用 35 万行 Rust 复盘 AI Agent 评估：从证据开始

- 来源：AI HOT 精选
- 发布时间：2026-09-18T13:38:06.061Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57352
- 原文：https://tessl.io/blog/ai-agent-evaluation-starts-with-evidence

## 摘要

Justin Cormack 让 AI 写了一个兼容 S3 的对象存储系统，代码量干到了 35 万行 Rust。他直接拿真实的 S3 当“标准答案”来跑测试，攒了 1500 个测试用例，结果还真抓到了 S3 自己的 500 错误。他踩了几个坑：追 100% 代码覆盖率会让 AI 写一堆没用的测试凑数；AWS 的文档经常不准，AI 也不擅长从文档里挖边界...

## 推荐理由

这是一篇带真实数字和踩坑记录的一手实验，不是泛泛而谈。35 万行 Rust + 1500 个测试用例的规模让结论有分量。扣分点在于文章本质上是 Tessl 的品牌内容，所以没给到 85 分以上。但实验本身的方法论——拿真实 S3 当标准答案来测 AI 生成的代码——对从业者很有启发。

## 锐评

Justin Cormack 这个实验挺实在的，他让 AI 写了一个兼容 S3 的对象存储，代码量干到 35 万行 Rust。他没去一行行读代码，而是直接把真实的 S3 当成“标准答案”来跑测试，攒了 1500 个测试用例。这招挺聪明，因为 AWS 的文档经常不准，AI 也不擅长从文档里挖边界情况，直接对比真实行为反而更靠谱。测试过程中还意外抓到了 S3 自己的 500 错误，说明这套“用真货当裁判”的方法能发现一些连原版都没藏好的问题。

他踩的坑也值得记一下。追 100% 代码覆盖率会让 AI 写一堆没用的测试凑数，对提升信心没啥帮助。测试是拿来发现不确定性的，不是凑指标。另外他定了个硬规矩：不稳定的测试必须立刻修掉，不然 AI 会学会忽略失败。

文章没具体说这 35 万行代码里有多少是 AI 独立写的、人工改了多少，也没给出性能对比数据。如果想知道这套方法能不能复制到其他大型系统上，还得看他后续会不会公开更细的工程指标。
