# OpenAI 和 Anthropic 互相拿对方模型做安全测试，公开了第一份联合作业结果

> 原标题：OpenAI and Anthropic share findings from a joint safety evaluation

- 来源：OpenAI News
- 发布时间：2025-08-27T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/489
- 原文：https://openai.com/index/openai-anthropic-safety-evaluation

## 摘要

两家公司互相用自家内部的安全考题去测对方公开的模型，这次先放出的是 OpenAI 测 Claude 的结果。测试前双方都松绑了一些外部安全限制，所以这不是严格的一对一排名。在指令优先级上，Claude 4 系列表现最好，比 OpenAI o3 还略强一点，尤其在抵抗系统提示词被套走这件事上很稳。越狱测试里 Claude 不如 OpenAI o3 和 o...

## 推荐理由

OpenAI和Anthropic互相拿对方6个公开模型做了一轮安全评测，这事本身比具体分数更有看头。Claude 4在指令层级和系统提示提取上表现靠前，幻觉测试里Claude模型拒答率最高到70%——但正文明确说了，两家都放宽了部分外部护栏，所以这不是严格可比的横向排名。我会先打个折：数字可以参考，别直接拿来比高低。真正该盯的是方法边界，比如评测设计里哪些护栏被松开了，这直接决定结论能推到什么程度。

## 锐评

两家公司终于把安全测试从自说自话变成了互相出题，这次先放出来的是OpenAI测Claude的结果。Claude 4系列在指令优先级上表现最好，尤其在抵抗系统提示词被套走这件事上很稳，比OpenAI o3还略强一点。但在越狱测试里，Claude就不如o3和o4-mini能扛了。

有个细节得注意：双方为了跑通测试，都松绑了一些模型外部的安全限制，所以这些数字不能直接拿来当排名看。OpenAI自己也说，这不是严格的一对一对比，更多是探索模型在极端情况下的倾向。

正文没披露具体测试样本量和统计显著性，也没说这些越狱攻击在真实场景里的成功率有多高。另外，幻觉测试里Claude的拒绝率高达70%，但没解释这是好事（宁可不说也不乱编）还是坏事（该答的也不答）。这些缺口让结论得打个折。
