# OpenAI 用“规则打分”替代部分人工反馈，让模型在安全问题上更听话

> 原标题：Improving Model Safety Behavior with Rule-Based Rewards

- 来源：OpenAI News
- 发布时间：2024-07-24T09:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/741
- 原文：https://openai.com/index/improving-model-safety-behavior-with-rule-based-rewards

## 摘要

OpenAI 在 7 月 24 日公开了他们用在安全对齐上的新方法：Rule-Based Rewards（RBRs），也就是用一套事先写好的规则给模型回复打分，而不是每次都靠人反复标注。这套方法把模型面对敏感请求时的反应分成三类——硬拒绝（简短道歉并明确说不）、软拒绝（带同理心地拒绝）和正常遵从——然后针对每类行为设定具体的评判标准，比如“回复是否在说...

## 推荐理由

我会先打个折：正文截取部分没给具体效果数字，也没对比基线，所以分数压在 78–84 这个区间。但 OpenAI 把安全规则显式写进奖励模型这件事本身值得关注，因为它解决的是工程上很实际的麻烦——政策一改，不用重新雇人标一堆数据，改规则就行。三种响应模式（硬拒、软拒、合规）让模型拒绝时不会太生硬，这点对产品体验有帮助。不过别太激动，论文没披露误拒率或漏判率，实际线上表现还得看后续有没有更细的评测。

## 锐评

这篇博客讲的是 OpenAI 从 GPT-4 起就在用的一套安全对齐方法：Rule-Based Rewards（RBRs）。说白了，就是不再每次都靠人海战术去标注“这个回答安不安全”，而是事先写好一套明确的评判规则，让模型自己对着规则打分。他们把模型面对敏感请求的反应分成三类：硬拒绝（简短道歉并说不）、软拒绝（带同理心地拒绝）和正常遵从，然后针对每类行为设定具体的检查点，比如拒绝时“不能啰嗦”、“不能高高在上地评判用户”。

这个方法最大的卖点是维护成本低。安全政策一变，改规则就行，不用把之前的人工反馈数据全部作废重来。文章提到 RBRs 已经用在 GPT-4o mini 等模型上，是 OpenAI 安全栈的一部分。但需要注意，整篇博客没给出任何量化对比，比如用了 RBRs 之后，安全指标提升了多少，或者省下了多少人工标注成本。这些关键数字的缺失，让“显著增强安全性”这个结论只能先打个折。

另外，这套规则本身还是人写的，怎么保证规则没漏洞、覆盖全，正文也没展开。如果想知道它比纯人类反馈强在哪，还得去看他们附带的论文里有没有更硬的实验数据。
