# OpenAI 公开两篇红队测试论文：一篇讲怎么请外部专家找茬，一篇讲怎么用 AI 自动找茬

> 原标题：Advancing red teaming with people and AI

- 来源：OpenAI News
- 发布时间：2024-11-21T10:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/670
- 原文：https://openai.com/index/advancing-red-teaming-with-people-and-ai

## 摘要

OpenAI 在 2024 年 11 月 21 日发了两篇论文，把自家红队测试（就是找人来攻击模型、挖风险）的方法摊开来讲。第一篇白皮书专门说外部人类红队的流程，讲了三个具体设计选择：一是根据威胁模型挑人，比如要找懂网络安全、会小语种或熟悉某地区政治的人；二是给测试员看哪个版本的模型，没加安全措施的早期版本能测出新能力带来的风险，加了措施的版本能测防护...

## 推荐理由

我会先打个折：正文对自动化红队的实验指标和效果摘录不全，这点先别太激动。但 OpenAI 这次把外部红队怎么组队、怎么分配模型版本、怎么收反馈这三件事说清楚了，流程比“红队”这个词本身值钱。如果是真的按威胁建模来组队，安全团队可以直接抄作业。

## 锐评

OpenAI 这次发了两篇论文，一篇白皮书详细说了他们怎么组织外部人类红队测试，另一篇研究论文介绍了一种新的自动化红队方法。白皮书里讲了三个挺实在的设计选择：一是根据威胁模型挑人，比如要找懂网络安全、会小语种或熟悉某地区政治的人，而不是随便凑数；二是给测试员看不同版本的模型，没加安全措施的早期版本能测出新能力带来的风险，加了措施的版本能测防护是否到位；三是通过 API 或 ChatGPT 界面收集结构化的反馈。这些做法对做安全测试的团队有参考价值。

但关于自动化红队那篇，正文只给了个概念图，说 AI 能帮忙大规模脑暴和生成攻击样本，具体用了什么指标、成本降了多少、发现了多少人类没找到的问题，全都没披露。这就让判断打了折扣——方法听起来有用，但验证强度未知。另外，白皮书也没说清楚外部测试员的规模、测试周期和实际发现的高危漏洞数量。想照着抄作业的团队，还得等他们把数据补上。
