# GPT-5 的安全训练不再一刀切拒绝，改看回答本身安不安全

> 原标题：From hard refusals to safe-completions: toward output-centric safety training

- 来源：OpenAI News
- 发布时间：2025-08-07T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/504
- 原文：https://openai.com/index/gpt-5-safe-completions

## 摘要

OpenAI 在 GPT-5 上换了一种安全训练思路，叫“安全补全”。以前模型是看用户问题有没有风险，有风险就直接拒绝；现在改成看模型生成的回答本身是否安全，尽量在安全边界内给出最有用的回复。具体做法是两条：回答违规就按严重程度扣分，回答安全就按有用程度加分。文章拿一个问烟花点火电路参数的例子对比，o3 直接给了具体电流、电阻值，GPT-5 则拒绝给细...

## 推荐理由

这篇值得看，因为 OpenAI 在 GPT-5 上把安全训练的逻辑翻了个面：不再盯着问题拒答，而是盯着回答本身是否安全、有用。正文举了烟火点火的例子，o3 直接给参数，GPT-5 拒绝细节但给了合规替代方案，落地感很强。我会先打个折——标题说安全性和有用性都提升，但截取部分没放具体分数、基准名和提升幅度，这点先别太激动。如果是真的，这种按严重性惩罚、按有用性奖励的机制，对做对齐和生产的团队都挺省钱省事。

## 锐评

OpenAI 这次把安全训练从“看问题”改成了“看回答”。以前模型判断用户问题有风险就直接拒绝，现在叫“安全补全”，目标是回答本身不越界，就尽量给出有用的内容。做法分两条：回答违规按严重程度扣分，回答安全就按有用程度加分。文章用了一个烟花点火电路参数的问题做对比，o3 直接给了具体电流、电阻值，GPT-5 则拒绝给细节，转而提供合规的替代方案。

这个例子能看出思路的转变，但文章最大的问题是没给数据。正文只说了“安全性和有用性都更好”，但没披露任何基准测试名称、分数或提升幅度。没有数字，就没法判断这种改进是实质性的还是只是换个说法。另外，这种输出端的安全判断，对模型在长对话里被逐步诱导的情况效果如何，文章也没提。

整体看，方向有道理，但现阶段只能当个技术信号看，实际效果还得等第三方评测或 OpenAI 自己放出数据。
