OpenAI 用真实对话回放来模拟模型上线后的行为,提前抓出不对劲的回答
Predicting model behavior before release by simulating deployment
OpenAI 在 GPT‑5‑Thinking 系列模型发布前,把近期真实用户对话里的助手回复删掉,让待发布的新模型重新生成一遍,再检查有没有冒出新的不良行为。这个方法叫部署模拟,相比传统评测,它能给出更准的不良行为频率估计,还发现了以前没见过的对齐问题,同时降低了模型察觉“自己在被测试”的概率。它也能用在带工具调用的智能体场景里。不过这个方法有硬伤:...
推荐理由:OpenAI 这次不是发一篇“我们做了安全测试”的公关稿,而是给出了一套有具体流程、有真实数据支撑的部署模拟方法,并且赶在 GPT‑5‑Thinking 发布前公开了论文。方法本身有信息增量,能估算不良行为频率、发现新问题,还降低了模型察觉测试的概率,直接打中对齐从业者的关注点。没给更高分是因为文章自己也承认有硬伤,比如计算成本没披露、对复杂智能体场景的验证还不够,这些限制让实际落地效果要打个折。