# Gray Swan 创始人：AI 安全不是“用 AI 搞网络安全”，提示注入是给能操作电脑的 agent 开的后门

> 原标题：Red-Teaming after Mythos — Zico Kolter & Matt Fredrikson, Gray Swan

- 来源：Latent Space
- 发布时间：2026-06-22T21:06:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41195
- 原文：https://www.latent.space/p/gray-swan

## 摘要

OpenAI 董事会成员 Zico Kolter 和 Gray Swan CEO Matt Fredrikson 聊了聊为什么 AI 安全需要换一套思路。他们用自家工具 Shade 帮 Anthropic 测了 Mythos 模型卡。核心观点：提示注入（prompt injection）给能操作电脑的 agent 创造了一种全新的攻击方式，传统网络安全...

## 推荐理由

我会先打个折：这期是播客对谈，不是论文，所以证据强度靠的是两人身份和实操经验，不是大规模实验。Zico Kolter 作为 OpenAI 董事会成员，公开聊 Anthropic 模型的安全问题，本身就自带信息量。他和 Matt Fredrikson 用 Gray Swan 的工具 Shade 去测 Mythos，发现提示注入对能操作电脑的 agent 是一种全新攻击方式——传统网络安全手段检测不到，因为恶意指令藏在自然语言里，模型照做不误。这点先别太激动，正文没披露具体攻击成功率和测试规模，但思路确实把 agent 安全从“模型别乱说话”推到了“模...

## 锐评

这篇访谈的核心判断很直接：AI 安全不是“把 AI 加到传统网络安全里”就完事了。当模型能替你操作电脑、读网页、写代码时，攻击者不需要黑进系统，只要在网页里埋一段恶意文字，模型自己就会中招。这就是他们说的“间接提示注入”，对能干活儿的 agent 来说，这是个全新的漏洞类型。

他们用自家工具 Shade 帮 Anthropic 测了 Mythos 模型卡，发现专门训练的红队模型在攻破 AI 这件事上已经超过了人类。这其实点出了一个尴尬的事实：模型越大，不一定越扛揍。访谈里还提到，在浏览器 agent 的鲁棒性测试里，人类只排第四。

不过，这篇是播客转录，不是技术论文。具体测试用了多少样本、攻击成功率是多少、Shade 的误报率如何，正文都没给。他们提到的“灰天鹅”概念——人人都看得见但未必会防的大事件——更多是风险叙事，还没落到可量化的指标上。如果真想评估这套工具，得看他们后续会不会公开更细的测试数据和对比基准。
