跳到正文
MIT Technology Review · AI

大模型有个根本性漏洞,靠打补丁修不好

A fundamental flaw leaves LLMs strikingly vulnerable to attack

一群研究者在 ICML 会议上指出,大语言模型没法做到完全防攻击,问题出在它们用来区分“谁在说话”的角色标签上。攻击者可以伪造模型的思考过程(他们管这叫“思维链伪造”),让模型以为指令是自己想出来的,然后照做。他们用这招让 OpenAI 的 gpt-oss-20b 和 GPT-5 输出了制造可卡因和破坏飞机导航系统的步骤。研究者认为,靠红队测试和事后打...

推荐理由:ICML 会议上的一篇研究,发现大模型用来区分“用户指令”和“系统提示”的角色标签有结构性漏洞。攻击者可以往模型“思考过程”里塞假内容,让模型以为危险指令是自己想出来的,然后照做。研究者用这招让 OpenAI 两个模型输出了制毒和破坏飞机导航的步骤。方法具体、有模型名称、有会议背书,可信度不低。没给满分是因为目前还是会议报告,没看到完整论文和修复方案,实际影响要等更多细节出来再判断。

读原文 ↗导出 Markdown