# Anthropic 说他们基本搞定了提示注入攻击，Claude Code 下周默认开自动模式

> 原标题：Anthropic 称已基本解决提示注入攻击

- 来源：AI HOT 精选
- 发布时间：2026-08-09T18:32:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49645
- 原文：https://x.com/bcherny/status/2086520950259118464

## 摘要

Anthropic 的 Boris Cherny 放话，通过模型训练加上多层防御，Claude 面对没见过的间接提示注入攻击，成功率已经压到接近零。这个数字来自独立研究者的基准测试，防御手段包括模型本身训练、输入探测和意图分类器，不是单靠某一招。不过正文没披露具体防御架构和测试范围，这点先别太激动。另外 Claude Code 的 auto 模式下周起...

## 推荐理由

Anthropic 安全头头 Boris Cherny 放话，靠模型训练加多层防御，Claude 面对没见过的间接提示注入，独立测试成功率接近零。有数据有方法，不是纯 PR，但正文没披露具体防御架构和测试范围，所以分数先打 78，别太激动。对 AI 安全从业者来说，这是近期最值得关注的安全进展。

## 锐评

Anthropic 的 Boris Cherny 放话，Claude 面对没见过的间接提示注入攻击，成功率已经压到接近零。这个数字来自独立研究者的基准测试，不是他们自己关起门来测的，这点加分。防御手段是组合拳：模型本身训练、输入探测和意图分类器，不是单靠某一招。

但正文没披露具体防御架构和测试范围。不知道测试覆盖了多少种攻击手法，也不知道这些防御对更复杂的多步注入有没有用。另外，Claude Code 的 auto 模式下周默认开启，意味着模型会自主执行更多操作，这反而可能打开新的攻击面。

还缺的是：这套防御在真实业务场景里的表现，以及攻击者会不会很快找到绕过的方法。安全领域的攻防从来不是一锤子买卖。
