# 开源提示注入检测器几乎抓不到藏在工具输出里的真实攻击，Regex 检出率 0%，Meta Prompt Guard 2 只有 1%

> 原标题：Can open-source prompt-injection detectors catch realistic AI agent attacks?

- 来源：Hacker News 首页
- 发布时间：2026-09-24T06:37:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58625
- 原文：https://github.com/rudratoshs/buried-injections

## 摘要

这个基准测试把 629 条来自 AgentDojo 的注入攻击藏进搜索结果、邮件正文这类工具返回内容里，然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到，Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的，而是混在模型调用的工具输出里，所以现有检测器基本是瞎的。代码和复现步骤都公开了，但...

## 推荐理由

这个基准测试把 629 条 AgentDojo 的注入攻击混进搜索结果、邮件正文这类工具返回内容里，然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。Regex 一条都没抓到，Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的，而是藏在模型调用的工具输出里，所以现有检测器基本是瞎的。代码和复现步骤都公开了，实用价值加分。但只测了两个检测器，没有横向对比更多方案，所以分数先停在 78。

## 锐评

这个基准测试把 629 条来自 AgentDojo 的注入攻击藏进搜索结果、邮件正文这类工具返回内容里，然后拿 Regex 和 Meta 的 Prompt Guard 2 去测。结果很惨：Regex 一条都没抓到，Prompt Guard 2 只抓到 1%。攻击不是直接发给模型的，而是混在模型调用的工具输出里，所以现有检测器基本是瞎的。

这点先别太激动。测试只跑了两个开源方案，正文没披露任何商业检测器的对比数据，也没说攻击样本的难度分布。代码和复现步骤都公开了，但 629 条样本量不算大，能不能代表真实攻击场景还不好说。

还缺什么：一是跟商业检测器的横向对比，二是攻击成功率背后的具体原因分析——是检测器根本没看工具输出，还是看了但认不出来。这两点不补上，这个 1% 的数字就只能当个警示，不能直接拿来评估生产环境的风险。
