Justin Cormack 用 35 万行 Rust 复盘:评估 AI Agent,先拿证据,别看覆盖率
Justin Cormack 用 35 万行 Rust 复盘 AI Agent 评估:从证据开始
Justin Cormack 让 AI 写了一个兼容 S3 的对象存储系统,代码量干到了 35 万行 Rust。他直接拿真实的 S3 当“标准答案”来跑测试,攒了 1500 个测试用例,结果还真抓到了 S3 自己的 500 错误。他踩了几个坑:追 100% 代码覆盖率会让 AI 写一堆没用的测试凑数;AWS 的文档经常不准,AI 也不擅长从文档里挖边界...
推荐理由:这是一篇带真实数字和踩坑记录的一手实验,不是泛泛而谈。35 万行 Rust + 1500 个测试用例的规模让结论有分量。扣分点在于文章本质上是 Tessl 的品牌内容,所以没给到 85 分以上。但实验本身的方法论——拿真实 S3 当标准答案来测 AI 生成的代码——对从业者很有启发。