# OpenAI 公开了开源模型 gpt-oss 的极端风险测试方法，并据此决定放行发布

> 原标题：Estimating worst case frontier risks of open weight LLMs

- 来源：OpenAI News
- 发布时间：2025-08-05T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/510
- 原文：https://openai.com/index/estimating-worst-case-frontier-risks-of-open-weight-llms

## 摘要

OpenAI 发了一篇技术文章，讲他们怎么评估开源模型 gpt-oss 在最坏情况下可能被用歪的风险。他们用的方法叫“恶意微调”，说白了就是故意把模型往坏里教：在生物风险这块，让模型上网查资料、用强化学习训练它搞威胁制造；在网络攻击这块，把它扔进一个能写代码干活的环境里打 CTF 解题赛。测完发现，被恶意调教过的 gpt-oss 还是打不过他们自家的闭...

## 推荐理由

我会先打个折：正文只给了相对结论，说 gpt-oss 在两项恶意微调后仍落后于 OpenAI o3，但具体分数、用了多少训练量、触发发布禁令的阈值全都没披露。这点先别太激动，信息缺口不小。真正该盯的是方法论——用恶意微调当最坏情况探针，而不是标题里“开放权重风险”那个大词。对从业者来说，这两套评估环境的设计思路比结论本身更有参考价值。

## 锐评

OpenAI 这篇讲的是他们怎么给开源模型 gpt-oss 做“最坏情况”压力测试，方法叫恶意微调。说白了，就是故意把模型教坏：在生物风险上，让模型上网查资料，用强化学习训练它搞威胁制造；在网络攻击上，把它扔进一个能写代码干活的环境里打 CTF 解题赛。

测完发现，被恶意调教过的 gpt-oss 还是打不过他们自家的闭源模型 o3，而且 o3 本身在生物和网络安全上的评级还没到“高危”。跟其他开源模型比，gpt-oss 在生物能力上可能有一点点提升，但没把开源的能力边界往前推多少。OpenAI 说，正是这些结果让他们决定把模型放出来。

这篇东西的价值主要在评估方法，而不是结论本身。正文没披露任何具体分数、训练规模，也没说清楚到底什么水平的风险算“可以放行”。所以这个“最坏情况”到底有多坏，读者只能靠猜。如果是真的，说明恶意微调这条路目前还没法让开源模型追上顶尖闭源模型，但前提是你得信 OpenAI 自己测自己的标准。
