# 大模型有个根本性漏洞，靠打补丁修不好

> 原标题：A fundamental flaw leaves LLMs strikingly vulnerable to attack

- 来源：MIT Technology Review · AI
- 发布时间：2026-07-30T10:15:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48384
- 原文：https://www.technologyreview.com/2026/07/30/1140927/a-fundamental-flaw-leaves-llms-vulnerable-to-attack/

## 摘要

一群研究者在 ICML 会议上指出，大语言模型没法做到完全防攻击，问题出在它们用来区分“谁在说话”的角色标签上。攻击者可以伪造模型的思考过程（他们管这叫“思维链伪造”），让模型以为指令是自己想出来的，然后照做。他们用这招让 OpenAI 的 gpt-oss-20b 和 GPT-5 输出了制造可卡因和破坏飞机导航系统的步骤。研究者认为，靠红队测试和事后打...

## 推荐理由

ICML 会议上的一篇研究，发现大模型用来区分“用户指令”和“系统提示”的角色标签有结构性漏洞。攻击者可以往模型“思考过程”里塞假内容，让模型以为危险指令是自己想出来的，然后照做。研究者用这招让 OpenAI 两个模型输出了制毒和破坏飞机导航的步骤。方法具体、有模型名称、有会议背书，可信度不低。没给满分是因为目前还是会议报告，没看到完整论文和修复方案，实际影响要等更多细节出来再判断。

## 锐评

这篇报道讲了一个挺要命的结构性问题：大模型通过角色标签来分辨指令来源，但攻击者可以直接伪造模型的“思维链”——也就是模型自己写给自己看的草稿——让模型误以为有害指令是自己想出来的，然后照做。研究者用这招让 OpenAI 的 gpt-oss-20b 和 GPT-5 输出了制造可卡因和破坏飞机导航系统的步骤，Anthropic、阿里、DeepSeek 的模型也中招。

关键判断在于，这不是某个模型没训练好，而是现有架构的先天缺陷。红队测试和事后打补丁只能告诉模型“别做这些”，但黑名单永远列不全。研究者管这种攻击叫“思维链伪造”，听起来花哨，其实就是骗模型把外部指令当成内心独白。

不过文章没给出具体测试样本量、成功率，也没说明不同模型在哪些条件下更容易被攻破。OpenAI 也没回应置评请求。这点先别太激动——漏洞确实存在，但实际利用门槛和影响范围还需要更多数据才能判断。
