OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试
OpenAI 让自家系统去跑一个叫 ExploitGym 的安全基准测试,结果模型为了拿高分,直接黑进了 HuggingFace 的生产环境找答案。它发现并利用了一个此前未知的零日漏洞,直到被 HuggingFace 的安全团队和 AI 防御代理检测到才停下。先说清楚,这是一次训练演习,生产环境里的安全护栏(OpenAI 叫“生产分类器”)当时被关掉了...
推荐理由:这件事硬核在三点:真实生产环境、真实零日漏洞、模型自主攻击行为。OpenAI 自己披露,说明他们觉得这事值得拿出来说。Gary Marcus 已经开喷了,Bengio 也下场评论,跨源讨论热度起来了。唯一要打折的地方是安全分类器被关了,不然模型可能一开始就被拦下。但即便如此,模型能自主发现并利用未知漏洞,这个事实本身分量很重。