# OpenAI 造了个叫 GPT-Red 的超级黑客模型，专门攻击自家模型来提前修漏洞

> 原标题：Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

- 来源：MIT Technology Review · AI
- 发布时间：2026-07-15T17:09:37.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45373
- 原文：https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/

## 摘要

OpenAI 训练了一个叫 GPT-Red 的模型，让它当自动化红队攻击手，在模型发布前找出漏洞并打补丁。它用自我博弈的方式不断变强：一边攻击其他模型，一边让防守模型学会抵抗。GPT-Red 发现了一种新攻击叫“假思维链”——往模型内部的推理笔记里塞伪造信息，模型会当成自己验证过的东西直接接受。在复现 2025 年人类红队测试时，GPT-Red 找到有...

## 推荐理由

OpenAI 用自我博弈训了一个自动化红队模型，还发现了一种叫“假思维链”的新攻击——这算是安全工具链上一个实打实的进展。MIT Tech Review 独家，给了具体机制和攻击例子。没给到 90 分以上是因为目前只有这一家信源，正文也没披露 GPT-Red 的规模、训练成本和误报率，这些信息缺口让我先打个折。

## 锐评

OpenAI 训练了一个自动红队模型 GPT-Red，用自我博弈的方式跟防守模型对打，双方都越打越强。这思路不新鲜，但落地到能发现新攻击类型，算是往前走了一步。它找到的“假思维链”攻击挺刁钻：攻击者往模型内部的推理草稿里塞伪造信息，模型会当成自己验证过的结论直接接受。这暴露出依赖思维链做安全判断的盲区——模型对“自己写的东西”戒心很低。

文章说 GPT-Red 在复现 2025 年人类红队测试时，找有效攻击的成功率更高，但没给具体数字，也没说高多少。这点先别太激动，没数据就没法判断是显著提升还是略好一点。另外，OpenAI 说这是为了应对模型变成能碰代码、网站、第三方工具的 agent 后攻击面变大的问题，逻辑说得通，但正文没披露 GPT-Red 在真实 agent 场景下的测试结果，目前还停在概念验证阶段。

还缺几块关键信息：GPT-Red 自己会不会被攻击者反过来利用？它的攻击成功率提升是靠花样多还是靠蛮力试？以及，这套方法对 OpenAI 之外的模型有没有用，正文完全没提。
