# 代码模型修 bug 时总爱把整个函数重写一遍

> 原标题：Coding Models Are Doing Too Much

- 来源：Hacker News 首页
- 发布时间：2026-04-22T17:51:17.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/8470
- 原文：https://nrehiew.github.io/blog/minimal_editing/

## 摘要

作者用程序给 BigCodeBench 的 400 道题植入单点 bug，发现很多模型在修 bug 时会过度编辑——明明改一行就能修好，它却把半个函数重写了，甚至加一堆没必要的检查。文章用 token 级编辑距离来量化这种“改多了”的程度，并尝试通过训练让模型学会只做最小改动。正文没披露最终测试结果和模型排名，也没说训练后到底省了多少编辑量。

## 推荐理由

这篇文章的切入点很巧，用 400 道题的 bug 注入实验把“模型修 bug 时过度改写”这个模糊感受变成了可量化的编辑距离。对 AI 编程工具的用户来说，多改一行正确代码就是多一份审查成本和上线风险，所以相关性直接拉满。不过正文截取没给出具体结果、模型排名和效果幅度，我会先打个折——知道问题存在，但不知道严重到什么程度、哪些模型更爱乱改，这点先别太激动。

## 锐评

这篇博客提出了一个很实际的观察：现在的代码模型在修 bug 时普遍存在“过度编辑”的问题。作者没有用另一个模型去生成 bug，而是自己写程序给 BigCodeBench 的 400 道题植入单点错误，比如把小于号改成小于等于号。这样做的好处是，正确答案非常明确——把改动原样改回去就行，这为衡量“改多了”提供了一个干净的标尺。

文章用 token 级的编辑距离来量化模型输出和最小改动之间的差距，并尝试通过训练让模型学会只做最小编辑。但这里有个关键的信息缺口：正文只描述了方法和动机，没有披露任何模型的最终测试排名，也没说训练后到底省了多少编辑量、对正确率有没有影响。所以目前只能把它当作一个有趣的问题定义和实验框架，还不能当作一个已验证的解决方案。

对从业者来说，这个方向值得关注，因为它直接关系到代码审查的效率。如果模型每次修 bug 都重写半个文件，审查者就得花大量精力去理解哪些改动是必要的、哪些是模型自作主张加的。但在这篇博客给出具体数据之前，我们没法判断这个问题的严重程度，以及作者提出的训练方法是否真的有效。
