# Trail of Bits 认为 1Password 的 AI 修漏洞基准测试有误导性，并发布两个补丁验证工具

> 原标题：Trail of Bits 批评 1Password 的 AI 补丁基准存在误导，并发布两个补丁验证 Agent 技能

- 来源：AI HOT 精选
- 发布时间：2026-09-15T11:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56688
- 原文：https://blog.trailofbits.com/2026/09/15/1passwords-ai-patching-benchmark-is-misleading

## 摘要

Trail of Bits 重新分析了 1Password 那份说 AI 只能修好 26% 漏洞的报告，发现这个数字是把故意让 AI 修错、以及不让 AI 跑代码测试的实验结果都混在一起算出来的。如果把条件限定在 AI 能跑代码、且没被故意带偏的测试里，86% 的补丁都能挡住提供的攻击代码。这个 26% 的标题数字会让安全团队误以为 AI 修漏洞不靠谱...

## 推荐理由

Trail of Bits 重新扒了 1Password 那份说 AI 只能修好 26% 漏洞的报告，发现这个 26% 是把故意让 AI 修错、以及不让 AI 跑代码测试的结果全混在一起算出来的。如果把条件限定在 AI 能实际跑代码验证、且没被故意带偏的测试里，86% 的补丁都能挡住提供的攻击代码。这个标题数字会让安全团队误以为 AI 修漏洞很不靠谱，而 Trail of Bits 用数据说明问题出在测试设计上，不是 AI 本身不行。

## 锐评

Trail of Bits 重新扒了 1Password 那份 FLAWED 报告的原始数据，发现 26% 这个标题数字有很强的误导性。报告里有两类实验明显不是正常修漏洞的场景：一类是直接告诉 AI“请按这个错误方法修”，这类占了 22% 的数据；另一类是不让 AI 编译或跑测试，占了 36%。把这些干扰项去掉，只看 AI 能正常跑代码、没被故意带偏的测试，生成的补丁里有 86% 都能挡住提供的攻击代码。这个数字当然不等于完美修复，但比 26% 更能反映实际可用性。

Trail of Bits 还顺手发了两个给 AI 用的技能插件，一个帮 AI 自动验证补丁，一个帮工程师审阅补丁。不过正文没披露这两个技能自己的性能数据，效果怎么样还得自己试。另外，1Password 选的六个漏洞本身修复难度偏高，不同漏洞的修复率从 3% 到 60% 不等，所以平均数字对样本构成很敏感，换一批漏洞结论可能又不一样。
