OpenAI 公布 deliberative alignment:让模型先读安全规范再推理,o1 在安全基准上超过 GPT-4o
Deliberative alignment: reasoning enables safer language models
OpenAI 在 12 月 20 日介绍了 deliberative alignment,一种直接让推理模型学习人类写的安全规范文本,并在回答前先对着规范做推理的训练方法。o 系列模型用上了这套方法,推理时会在思维链里调取内部政策、判断请求是否违规,再给出回复。整个过程不需要人工标注思维链或答案。文章说 o1 在内部和外部安全基准上大幅超过 GPT-4...
推荐理由:我会先打个折:正文没给 o1 的具体基准分数,只说比 GPT-4o 强很多、部分数据集接近饱和,所以没法判断实际提升幅度。但方法本身有嚼头——用人类能看懂的安全规范训练模型在回答前显式推理,而且不需要人工写思维链样本,省了不少标注成本。安全对齐从“事后拦截”变成“事前想清楚”,这个转向值得关注。综合看,放在 featured 没问题,83 分也合理,毕竟缺了硬数据,离必写还差一口气。