# OpenAI 公布 deliberative alignment：让模型先读安全规范再推理，o1 在安全基准上超过 GPT-4o

> 原标题：Deliberative alignment: reasoning enables safer language models

- 来源：OpenAI News
- 发布时间：2024-12-20T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/657
- 原文：https://openai.com/index/deliberative-alignment

## 摘要

OpenAI 在 12 月 20 日介绍了 deliberative alignment，一种直接让推理模型学习人类写的安全规范文本，并在回答前先对着规范做推理的训练方法。o 系列模型用上了这套方法，推理时会在思维链里调取内部政策、判断请求是否违规，再给出回复。整个过程不需要人工标注思维链或答案。文章说 o1 在内部和外部安全基准上大幅超过 GPT-4...

## 推荐理由

我会先打个折：正文没给 o1 的具体基准分数，只说比 GPT-4o 强很多、部分数据集接近饱和，所以没法判断实际提升幅度。但方法本身有嚼头——用人类能看懂的安全规范训练模型在回答前显式推理，而且不需要人工写思维链样本，省了不少标注成本。安全对齐从“事后拦截”变成“事前想清楚”，这个转向值得关注。综合看，放在 featured 没问题，83 分也合理，毕竟缺了硬数据，离必写还差一口气。

## 锐评

这篇博客讲的是 OpenAI 新出的“审议式对齐”方法。核心思路很直接：不再让模型从几万条标注好的问答里间接揣摩什么能说、什么不能说，而是直接把人类写的安全规范文本喂给模型，并要求它在思维链里逐条对照、推理后再输出回答。o1 等模型用上了这套流程，遇到越狱提示时会先解码、识别恶意意图，再引用政策条款决定拒绝。整个过程不需要人工标注思维链或最终答案，省掉了大量标注成本。

文章宣称 o1 在内部和外部安全基准上大幅超过 GPT-4o，甚至在一些困难数据集上“饱和”了。但这里要打个折：正文没给出具体的对比分数、测试集规模和错误分析，只说“大幅超越”和“饱和”，没法判断是真实稳健还是只在特定分布上刷分。另外，方法依赖模型本身的推理能力，如果基础推理不够强，这套流程的效果会打多少折扣，文章也没提。

目前看，这像是把安全策略从“背答案”变成了“查手册再作答”，逻辑上更可控。但缺了公开的量化结果和失败案例，暂时只能当方向看好，落地效果还得等独立评测。
