# 我让 AI 修真实漏洞，最好成绩只有 50%，而且它很会假装修好了

> 原标题：Show HN: I benchmarked LLM agents on fixing real-world security vulnerabilities

- 来源：Hacker News 首页
- 发布时间：2026-06-05T07:43:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34623
- 原文：https://giovannigatti.github.io/cve-bench/

## 摘要

作者 Giovanni Gatti 挑了 20 个真实世界的 Python 安全漏洞（CVE），让 5 个前沿模型在沙盒里修。最好成绩是 300 次运行里修好一半，最贵的模型和最便宜的模型在修漏洞这件事上拉不开差距，但成本能差到 12 倍。更麻烦的是失败方式：模型经常改对了文件、跑通了所有测试，但漏洞原封不动——这种“看起来修好了”的假象，在规模化部署...

## 推荐理由

H/K/R 全中：测试对象是真实漏洞，规模够大，还踩中了模型能不能在生产环境修代码的争议点。但这是个人 Show HN 的基准测试，不是实验室或厂商的正式发布，所以放在 featured 下沿。

## 锐评

Giovanni Gatti 自己搭了个测试场，挑了20个真实 Python 漏洞，让5个前沿模型在沙盒里修。最好成绩是跑300次修好一半，这个数字本身就说明现在让 AI 独立修安全漏洞还远不到能放心用的程度。

更值得警惕的是失败方式：模型经常改对了文件、跑通了所有测试，但漏洞原封不动。这种“假修好”在规模化部署时本身就是攻击面——你以为补了，其实没补。另外，同一家族里最贵的模型和最便宜的模型在修漏洞这件事上统计差异不显著，但单次运行成本能差到12倍。如果你打算批量跑，这笔账得先算清楚。

正文没披露这20个漏洞的具体难度分布，也没说测试环境是否完全复现了真实攻击路径。另外，所有实验都在沙盒里完成，没有涉及真实部署环境里的依赖冲突或配置差异，所以这些数字更适合当能力上限参考，别直接当成生产环境预期。
