跳到正文
Hacker News 首页

安全研究员用间接提示注入攻破 Claude Code Opus 5 自动模式,成功率最高 80%

Breaking Claude Code Opus 5 Auto Mode

安全研究员 wunderwuzzi 发了一篇博文,演示怎么用一句“帮我总结这个网页”就把 Claude Code Opus 5 的自动模式给劫持了。攻击链条挺巧妙:先靠服务器返回一个 HTTP 415 状态码,让模型自己决定不用内置的网页抓取工具,而是改用 curl 命令去下载一个 ZIP 压缩包。压缩包里有个解码二进制文件,模型出于安全考虑拒绝运行它...

推荐理由:我会先打个折:正文没披露测试环境的具体版本号和补丁状态,60-80% 的成功率是在特定条件下测出来的,别直接当成所有场景都这么高。但这条攻击链确实巧妙,用 HTTP 415 让模型自己决定换工具,等于把决策权交还给了不可信的远端,比直接注入提示词更难防。文章把每一步怎么走通、模型为什么会上当都拆开了,对做 AI 应用安全的人有直接参考价值,所以给了 featured。

读原文 ↗导出 Markdown