# 代码审查不只是查错：John Allspaw 反驳“用 AI 代理取代人类审查”的论文

> 原标题：There is more to code review than (automatable) detection

- 来源：Hacker News 首页
- 发布时间：2026-09-26T15:06:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59288
- 原文：https://www.adaptivecapacitylabs.com/2026/08/24/there-is-more-to-code-review-than-automatable-detection/

## 摘要

John Allspaw 直接开怼一篇声称“编程代理能取代人类代码审查”的论文，认为论文把审查简化成了缺陷检测、风格检查、知识传递和意识通知这四件可自动化的事，完全没抓住人真正在干什么。他列了七点反驳：第一，资深工程师说“我看不懂”本身就是发现——代码太绕或抽象错了，而大模型永远能“处理”代码，给不出这种真实的困惑信号。第二，人会质疑这个改动到底有没有...

## 推荐理由

John Allspaw 没在讲情怀，而是拿自己一线的经验，把一篇论文的假设拆得干干净净。他列出的七点反驳，每一条都对应代码审查里人实际在做的认知判断，不是“AI 还不行”这种空话。文章信息密度高，但读起来不累，对正在推 AI 编程工具的团队是个很好的冷静提醒。作为观点文章，它缺实验数据支撑，但论证本身扎实，放在 featured 里能引发有价值的讨论。

## 锐评

这篇反驳的核心论点很清晰：论文把代码审查拆成缺陷检测、风格检查、知识传递和通知四件事，然后说 AI 都能干，所以能取代人。但 Allspaw 列了七点反驳，每一点都打在“人到底在审什么”上。比如资深工程师说“我看不懂”，这本身就是发现——代码太绕或抽象错了，而大模型永远能“处理”代码，给不出这种真实的困惑信号。再比如人会质疑这个改动到底有没有必要，会注意到“该有的东西没写”，会根据谁写的代码来调整审查力度，这些都不是简单的检测功能。

文章没给定量实验，纯靠经验论证，所以说服力取决于你认不认同他的工程直觉。正文没披露那篇被怼的论文具体用了什么评测基准，也没说代理在真实生产环境的表现数据。如果那篇论文的实验设计本身就弱，那 Allspaw 的批评就更站得住脚；但如果对方有扎实的对照实验，这里就缺了正面交锋。

还缺一块：他没讨论如果代理和人类搭配着用，能不能补上这些“非功能性”的审查维度。比如代理先扫一遍，人再重点看意图和缺失，这种混合模式会不会比纯人审更高效。
