跳到正文
MIT Technology Review · AI

OpenAI 造了个叫 GPT-Red 的超级黑客模型,专门攻击自家模型来提前修漏洞

Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

OpenAI 训练了一个叫 GPT-Red 的模型,让它当自动化红队攻击手,在模型发布前找出漏洞并打补丁。它用自我博弈的方式不断变强:一边攻击其他模型,一边让防守模型学会抵抗。GPT-Red 发现了一种新攻击叫“假思维链”——往模型内部的推理笔记里塞伪造信息,模型会当成自己验证过的东西直接接受。在复现 2025 年人类红队测试时,GPT-Red 找到有...

推荐理由:OpenAI 用自我博弈训了一个自动化红队模型,还发现了一种叫“假思维链”的新攻击——这算是安全工具链上一个实打实的进展。MIT Tech Review 独家,给了具体机制和攻击例子。没给到 90 分以上是因为目前只有这一家信源,正文也没披露 GPT-Red 的规模、训练成本和误报率,这些信息缺口让我先打个折。

读原文 ↗导出 Markdown