# 代码能跑但写得烂：怎么衡量 AI 生成的代码有多“水”

> 原标题：If coding is solved, what now?: Measuring the sloppiness of code

- 来源：Hacker News 首页
- 发布时间：2026-09-11T13:42:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55913
- 原文：https://earendil.com/posts/measuring-code-sloppiness/

## 摘要

Sebastian 在 Earendil 的博客里用 SlopCodeBench 的指标测了 AI 写代码的“水分”。AI agent 写的代码平均啰嗦度 0.33，人类仓库只有 0.15；侵蚀度 0.68，人类是 0.31——AI 代码的啰嗦和臃肿程度大概是人类的两倍。在多轮、清空上下文的迭代测试里，哪怕最顶尖的模型，严格通过率也是 0%，坏决策会越...

## 推荐理由

Sebastian 在 Earendil 的博客里用 SlopCodeBench 测了 AI 写代码的“水分”，给了两个新指标：啰嗦度（verbosity）和侵蚀度（erosion）。AI agent 写的代码啰嗦度 0.33，人类仓库 0.15；侵蚀度 0.68，人类 0.31——AI 代码的臃肿程度大概是人写的两倍。多轮迭代测试里，哪怕最顶尖的模型，严格通过率也是 0%，坏决策会越滚越多。这个角度比泛泛说“AI 代码质量差”具体得多，直接量化了“能用但脏”的状态。我会先打个折：这是单篇博客，不是同行评审，SlopCodeBench 也没开源，可...

## 锐评

Sebastian 这篇博客用 SlopCodeBench 的指标给 AI 代码的“水分”做了个体检。AI agent 写的代码平均啰嗦度 0.33，人类仓库只有 0.15；侵蚀度 0.68，人类是 0.31——AI 代码的臃肿和复杂函数堆积程度大概是人类的两倍。更扎心的是，在多轮、清空上下文的迭代测试里，哪怕最顶尖的模型，严格通过率也是 0%，说明 AI 自己也没法收拾它生成的烂摊子。

作者试了一圈评估方法，发现让 AI 当裁判基本不靠谱，模型甚至会因为方案改个名就改变偏好；最有效的指标反而是最土的“代码行数变化”，但一用它做优化目标就会失效。正文没披露他下一步打算往哪个方向探索，也没给出具体的改进方案。

这篇的价值在于把“AI 代码很水”这个模糊感觉变成了可量化的数字，但局限也很明显：指标来自一篇论文，样本和场景的代表性存疑，而且只测了“写得烂”，没测“改得动”。
