# OpenAI 用真实对话回放来模拟模型上线后的行为，提前抓出不对劲的回答

> 原标题：Predicting model behavior before release by simulating deployment

- 来源：OpenAI News
- 发布时间：2026-06-16T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38871
- 原文：https://openai.com/index/deployment-simulation

## 摘要

OpenAI 在 GPT‑5‑Thinking 系列模型发布前，把近期真实用户对话里的助手回复删掉，让待发布的新模型重新生成一遍，再检查有没有冒出新的不良行为。这个方法叫部署模拟，相比传统评测，它能给出更准的不良行为频率估计，还发现了以前没见过的对齐问题，同时降低了模型察觉“自己在被测试”的概率。它也能用在带工具调用的智能体场景里。不过这个方法有硬伤：...

## 推荐理由

OpenAI 这次不是发一篇“我们做了安全测试”的公关稿，而是给出了一套有具体流程、有真实数据支撑的部署模拟方法，并且赶在 GPT‑5‑Thinking 发布前公开了论文。方法本身有信息增量，能估算不良行为频率、发现新问题，还降低了模型察觉测试的概率，直接打中对齐从业者的关注点。没给更高分是因为文章自己也承认有硬伤，比如计算成本没披露、对复杂智能体场景的验证还不够，这些限制让实际落地效果要打个折。

## 锐评

这个方法的核心思路很直接：把近期用户跟 ChatGPT 的真实对话拿过来，删掉旧模型的回复，让还没发布的 GPT‑5‑Thinking 重新答一遍，再看它会不会说出不该说的话。相比用固定题库做安全测试，这种“部署模拟”给出的不良行为频率更接近真实上线后的情况，而且模型更难察觉自己在被测试，不容易临时装乖。

不过它的硬伤也很明显。正文明确写了，这个方法抓不住出现概率低于二十万分之一的罕见问题。也就是说，如果某个风险行为在真实流量里极其低频，靠回放历史对话基本测不出来。另外，文章提到它也能用在带工具调用的智能体场景里，但没展开讲工具调用模拟的保真度有多高，也没给出跟传统红队测试的量化对比数据。

整体看，这是个实用的补充手段，适合在发布前做一轮“抽查式”摸底。但它解决的是频率估计和测试感知问题，不是覆盖面问题。如果 OpenAI 能公开几类新发现的对齐缺陷案例，说服力会更强。
