OpenAI 用 GPT-Red 自动找漏洞,让 GPT-5.6 抗 prompt 注入能力强了 6 倍
OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性
OpenAI 训了一个叫 GPT-Red 的自动化红队模型,专门通过自我博弈来找模型的安全漏洞,再把攻击样本喂给 GPT-5.6 做对抗训练。结果是在最难的直接 prompt 注入基准上,GPT-5.6 Sol 的失败次数比四个月前最好的生产模型少了 6 倍。OpenAI 说这是他们头一回把跟最大规模后训练相当的算力全砸在安全上。文章给了几个案例,比如...
推荐理由:OpenAI 第一次在主模型训练量级上做纯安全跑,而且给出了 GPT-5.6 Sol 在直接 prompt 注入上失败次数降 6 倍的具体数字,对红队和安全部署圈子来说是个硬参照。没打更高是因为目前只有一篇官方博客,没有第三方复现或更广的基准对比,实际泛化效果还得看后续验证。