ICML 论文把提示注入攻击归因于角色混淆:模型分不清网页数据和用户指令
A Theory of Why Prompt Injection Works
这篇 ICML 2026 论文换了个角度解释提示注入为什么一直防不住:问题出在模型对“角色标签”的感知上。大模型接收到的其实是一长串文本,靠 system、user、think、tool 这些标签来区分哪些是真人指令、哪些是外部数据。攻击者把恶意命令藏在 tool 标签包裹的网页内容里,模型一旦把 tool 里的文字误当成 user 指令,攻击就成功了...
推荐理由:我会先打个折:这是篇 ICML 2026 论文,不是产品更新,读起来有一定门槛。但它的核心观点很直白——提示注入之所以难防,不是因为模型笨,而是因为模型靠 system、user、tool 这些标签来区分“谁在说话”,攻击者把恶意指令藏在 tool 标签包裹的网页内容里,模型就把外部数据当成了真人指令。这个“角色标签感知混乱”的解释比常见的“模型被骗”说法更底层,也解释了为什么单纯靠输入过滤很难根治。论文给出了可复现的攻击方法和机制分析,正文没披露具体攻击成功率数字,这点先别太激动。对正在做 agent 安全或 LLM 防御的人,这篇值得看,但别指...