# OpenAI 发布 o1 系统卡：用大规模强化学习训练模型先想再答，安全风险定在“中”以下才上线

> 原标题：OpenAI o1 System Card

- 来源：OpenAI News
- 发布时间：2024-12-05T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/667
- 原文：https://openai.com/index/openai-o1-system-card

## 摘要

OpenAI 把 o1 和 o1-mini 的安全测试结果公开了。核心就一句话：o1 系列用大规模强化学习训练模型在回答前先进行“思维链”推理，这让它在遵循安全规则、抵抗越狱攻击上比前代强。但正文没披露具体的数据配比和完整基准分。安全方面，他们设了上线门槛——风险缓解后评分必须“中”或更低。目前给出的评分是：网络安全低、生化威胁中、说服能力中、模型自主...

## 推荐理由

这是一份前沿推理模型的高信号安全披露，不是常规物料。HKR-K 强在公布了部署门槛、四项风险评级和测试范围；HKR-R 成立是因为从业者持续关注推理模型的安全阈值和 CoT 透明度。事实核查：系统卡原文确实列出了这些评级和门槛，未发现错误或过时信息，安全建议也符合当前实践。

## 锐评

这份系统卡最值得看的一点是 OpenAI 确认了 o1 的训练方式：用大规模强化学习训练模型在回答前先进行“思维链”推理。这相当于让模型在后台先自己琢磨一遍，再给你答案。好处是它更懂安全规则，面对越狱攻击时能自己“想明白”哪些话不该说，所以抗越狱能力比前代强。

安全评分方面，他们设了硬门槛——风险缓解后评分必须“中”或更低才能上线。目前给出的结果是：网络安全低、生化威胁中、说服能力中、模型自主性低。但“中”这个评级本身就有点模糊，正文没解释“中”到底意味着多大实际风险，也没给出具体测试场景的细节。

另外，训练数据只说了“公开数据、合作数据和内部数据”这种套话，没披露数据配比、过滤标准，也没给完整的基准测试分数。这些缺口让外部很难独立验证他们说的“最先进安全性能”到底有多扎实。
