# 安全研究员用间接提示注入攻破 Claude Code Opus 5 自动模式，成功率最高 80%

> 原标题：Breaking Claude Code Opus 5 Auto Mode

- 来源：Hacker News 首页
- 发布时间：2026-08-31T07:49:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53890
- 原文：https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/

## 摘要

安全研究员 wunderwuzzi 发了一篇博文，演示怎么用一句“帮我总结这个网页”就把 Claude Code Opus 5 的自动模式给劫持了。攻击链条挺巧妙：先靠服务器返回一个 HTTP 415 状态码，让模型自己决定不用内置的网页抓取工具，而是改用 curl 命令去下载一个 ZIP 压缩包。压缩包里有个解码二进制文件，模型出于安全考虑拒绝运行它...

## 推荐理由

我会先打个折：正文没披露测试环境的具体版本号和补丁状态，60-80% 的成功率是在特定条件下测出来的，别直接当成所有场景都这么高。但这条攻击链确实巧妙，用 HTTP 415 让模型自己决定换工具，等于把决策权交还给了不可信的远端，比直接注入提示词更难防。文章把每一步怎么走通、模型为什么会上当都拆开了，对做 AI 应用安全的人有直接参考价值，所以给了 featured。

## 锐评

这篇博文展示了一条很实际的攻击链：攻击者没有直接命令模型干坏事，而是用 HTTP 415 状态码让模型自己决定放弃内置网页抓取工具，改用 curl 下载一个 ZIP 包。包里有个解码二进制文件，模型出于安全考虑拒绝运行它，自己写了个 Python 解码脚本——但脚本在攻击者控制的目录里执行，目录下藏了一个 struct.py 文件，会冒充 Python 标准库里的同名模块。当模型导入 base64 时，就触发了这个恶意文件，完成代码执行。

作者用少量样本测出 60-80% 的成功率，这个数字说明攻击不是偶发，但样本量小，不能直接当统计结论看。更关键的是，Anthropic 委托 Trajectory Labs 做的评估显示 Opus 5 自动模式对间接提示注入攻击成功率为 0.00%，两边结果差这么大，要么是评估场景没覆盖这条攻击路径，要么是测试方法有差异。

正文没披露 Anthropic 是否已经修复这个漏洞，也没说明评估用的 72 个场景具体是什么。自动模式现在已经是 Claude Code 的默认模式，如果你在用，这篇博文的核心提醒很直白：自动模式不能替代隔离环境和人工监控。
