# ICML 论文把提示注入攻击归因于角色混淆：模型分不清网页数据和用户指令

> 原标题：A Theory of Why Prompt Injection Works

- 来源：Hacker News 首页
- 发布时间：2026-06-22T15:48:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39881
- 原文：https://role-confusion.github.io

## 摘要

这篇 ICML 2026 论文换了个角度解释提示注入为什么一直防不住：问题出在模型对“角色标签”的感知上。大模型接收到的其实是一长串文本，靠 system、user、think、tool 这些标签来区分哪些是真人指令、哪些是外部数据。攻击者把恶意命令藏在 tool 标签包裹的网页内容里，模型一旦把 tool 里的文字误当成 user 指令，攻击就成功了...

## 推荐理由

我会先打个折：这是篇 ICML 2026 论文，不是产品更新，读起来有一定门槛。但它的核心观点很直白——提示注入之所以难防，不是因为模型笨，而是因为模型靠 system、user、tool 这些标签来区分“谁在说话”，攻击者把恶意指令藏在 tool 标签包裹的网页内容里，模型就把外部数据当成了真人指令。这个“角色标签感知混乱”的解释比常见的“模型被骗”说法更底层，也解释了为什么单纯靠输入过滤很难根治。论文给出了可复现的攻击方法和机制分析，正文没披露具体攻击成功率数字，这点先别太激动。对正在做 agent 安全或 LLM 防御的人，这篇值得看，但别指...

## 锐评

这篇 ICML 2026 论文换了个角度解释提示注入为什么一直防不住。核心观点是，大模型接收到的其实是一长串文本，靠 system、user、think、tool 这些角色标签来区分哪些是真人指令、哪些是外部数据。攻击者把恶意命令藏在 tool 标签包裹的网页内容里，模型一旦把 tool 里的文字误当成 user 指令，攻击就成功了。作者管这叫“角色混淆”，认为现有模型主要靠背攻击模式来防御，遇到人类红队换个说法就绕过去了。

这个解释框架挺直观，也解释了为什么静态基准分高但实战一捅就破。但文章没给出一个具体的防御方法，也没说什么时候能落地。它更像一个诊断：告诉你病根在角色感知上，而不是缺训练数据。

还缺什么？第一，没看到在主流 agent 产品上的实测数据，不知道这套理论能解释多大比例的真实攻击。第二，没提修复成本——让模型学会尊重角色标签，是需要改架构、加训练阶段，还是靠推理时的约束？这些都没展开。
