# OpenAI 用 GPT-Red 自动找漏洞，让 GPT-5.6 抗 prompt 注入能力强了 6 倍

> 原标题：OpenAI 发布 GPT-Red：通过自动化红队测试提升模型鲁棒性

- 来源：AI HOT 精选
- 发布时间：2026-07-15T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44568
- 原文：https://openai.com/index/unlocking-self-improvement-gpt-red

## 摘要

OpenAI 训了一个叫 GPT-Red 的自动化红队模型，专门通过自我博弈来找模型的安全漏洞，再把攻击样本喂给 GPT-5.6 做对抗训练。结果是在最难的直接 prompt 注入基准上，GPT-5.6 Sol 的失败次数比四个月前最好的生产模型少了 6 倍。OpenAI 说这是他们头一回把跟最大规模后训练相当的算力全砸在安全上。文章给了几个案例，比如...

## 推荐理由

OpenAI 第一次在主模型训练量级上做纯安全跑，而且给出了 GPT-5.6 Sol 在直接 prompt 注入上失败次数降 6 倍的具体数字，对红队和安全部署圈子来说是个硬参照。没打更高是因为目前只有一篇官方博客，没有第三方复现或更广的基准对比，实际泛化效果还得看后续验证。

## 锐评

OpenAI 这次把相当于最大规模后训练的算力全砸在安全上，训了个叫 GPT-Red 的自动化红队模型。它的工作方式就是自己跟自己玩攻防游戏，不断生成攻击 prompt 去试探目标模型，找到漏洞后把这些攻击样本收集起来，再拿去训练 GPT-5.6，让模型学会抵抗这些攻击。结果是在最难的直接 prompt 注入基准上，GPT-5.6 Sol 的失败次数比四个月前最好的生产模型少了 6 倍。文章给了几个案例，比如诱导模型泄露内部文件、转发 API 密钥、执行恶意构建脚本，看起来确实能抓到一些实际场景里的漏洞。

不过这篇公告的信息缺口也很明显。GPT-Red 到底多大、基于什么架构、训练配方是什么，正文一个字都没提。6 倍这个数字听起来漂亮，但基准测试本身有没有被针对性刷榜、测试集和训练数据有没有重叠，这些都没交代。另外，对抗训练通常会让模型在正常任务上掉点能力，文章只说“依然保持高能力”，没给具体数据对比。如果是真的，这确实是一条把安全投入和模型能力同步扩大的可行路径，但现阶段只能当方向性信号看。
