# OpenAI 开了个安全漏洞赏金计划，专门收 AI 滥用和越权操作的问题

> 原标题：Introducing the OpenAI Safety Bug Bounty program

- 来源：OpenAI News
- 发布时间：2026-03-25T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/150
- 原文：https://openai.com/index/safety-bug-bounty

## 摘要

OpenAI 在 2026 年 3 月 25 日上线了一个公开的“安全漏洞赏金”计划，跟之前的安全漏洞赏金不同，这次专门盯着 AI 被滥用或绕过安全限制的场景。主要收三类问题：一是智能体（比如浏览器里的 ChatGPT Agent）被第三方提示词注入劫持，导致泄露用户信息或执行有害操作，复现率得超过 50%；二是模型输出里意外暴露了 OpenAI 自己...

## 推荐理由

这不是模型发布或能力升级，而是一次治理流程更新，所以放在低 featured 档。但 OpenAI 把 AI 安全漏洞悬赏公开化，还划出了代理风险、专有信息泄露这些具体受理项，同时明确排除普通越狱，等于给行业打了个样。我会先打个折：正文没披露赏金金额和实际处理时效，实际效果还得看后续执行。

## 锐评

OpenAI 这次把安全赏金拆成了两条线：原来的继续收传统漏洞，新开的专门盯 AI 被滥用或绕过安全限制的场景。最值得关注的是智能体风险，比如浏览器里的 ChatGPT Agent 被第三方提示词注入劫持，导致泄露用户信息或执行有害操作。但门槛不低，复现率必须超过 50%，这意味着偶发性的攻击不会被受理，实际能拿到赏金的案例可能比想象中少。

另外，模型输出意外暴露 OpenAI 自己的内部信息也被列入范围，这点挺实在，说明他们承认模型可能记住并吐出不该说的东西。不过公告明确说了，通用越狱不在范围内，比如让模型说脏话或返回搜索引擎能查到的内容，这类提交不会给钱。

正文没披露赏金金额和分级标准，也没说预计处理周期。对想参与的研究者来说，最实际的问题是：什么样的危害算“实质性”，判断权完全在 OpenAI 手里，这会让提交前的不确定性比较大。
