# 仪表盘坏了：开发者感觉用 AI 快了 20%，实测慢了 19%

> 原标题：The gauge broke: devs felt 20% faster with AI, measured 19% slower

- 来源：Hacker News 首页
- 发布时间：2026-07-02T06:44:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41904
- 原文：https://intrepidkarthi.com/writing/the-gauge-broke/

## 摘要

METR 做了一项对照实验，让 16 名经验丰富的开源开发者在自己熟悉的代码库里干活，结果发现他们自我感觉速度提升了约 20%，但实际计时却慢了约 19%，感觉和事实差了近 40 个百分点。我会先打个折，这个实验样本不大，但问题在于，最有信心觉得自己变快的人，恰恰是实测变慢的人。这说明我们用来判断效率的“感觉”这个仪表盘，在最常见的真实工作场景下是反着...

## 推荐理由

METR这个对照实验是第一个用秒表去量“AI编码速度错觉”的——16个经验丰富的开发者，在自己熟悉的代码库里干活，自我感觉快了20%，实测却慢了19%。样本不大，正文也没披露完整实验设计，但结论太反直觉了：最有信心觉得自己变快的人，恰恰是实测变慢的人。这说明我们判断效率的“感觉”这个仪表盘，在最常见的真实工作场景下是反着转的。对天天用AI写代码的人来说，这条不是讲工具好不好用，而是提醒你该信秒表别信直觉。

## 锐评

这篇文章的核心判断很直接：我们用来衡量效率的“感觉”这个仪表盘，在真实工作场景下是反着转的。METR 的对照实验虽然只有 16 名开发者、246 个任务，样本不大，但它戳破了一个普遍幻觉——AI 让打字变快了，但打字从来不是老手在复杂代码库里的瓶颈。真正的瓶颈转移到了审核环节，代码生成量暴增，但审核资源没跟上，导致整体交付时间反而拉长。

文章引用的 Faros AI 数据（超万名开发者）和 GitClear 数据（2 亿行代码变更）也佐证了这一点：合并请求量翻倍、代码块变大、审核时间拉长，但净交付量没变，重构比例甚至跌到 10% 以下。这解释了为什么很多团队觉得“快了”但业务产出没变。

不过，文章也坦诚地指出这很可能是 J 型曲线的低谷期，新手和从零开发的项目确实在变快。目前最大的信息缺口是，没有数据说明当团队把审核流程也工具化之后，这个效率缺口能否被填平。如果只是加速生成而不重构审核流程，那感觉良好但实际减速的怪圈还会持续。
