跳到正文
Latent Space

Gray Swan 创始人:AI 安全不是“用 AI 搞网络安全”,提示注入是给能操作电脑的 agent 开的后门

Red-Teaming after Mythos — Zico Kolter & Matt Fredrikson, Gray Swan

OpenAI 董事会成员 Zico Kolter 和 Gray Swan CEO Matt Fredrikson 聊了聊为什么 AI 安全需要换一套思路。他们用自家工具 Shade 帮 Anthropic 测了 Mythos 模型卡。核心观点:提示注入(prompt injection)给能操作电脑的 agent 创造了一种全新的攻击方式,传统网络安全...

推荐理由:我会先打个折:这期是播客对谈,不是论文,所以证据强度靠的是两人身份和实操经验,不是大规模实验。Zico Kolter 作为 OpenAI 董事会成员,公开聊 Anthropic 模型的安全问题,本身就自带信息量。他和 Matt Fredrikson 用 Gray Swan 的工具 Shade 去测 Mythos,发现提示注入对能操作电脑的 agent 是一种全新攻击方式——传统网络安全手段检测不到,因为恶意指令藏在自然语言里,模型照做不误。这点先别太激动,正文没披露具体攻击成功率和测试规模,但思路确实把 agent 安全从“模型别乱说话”推到了“模...

读原文 ↗导出 Markdown