AI 安全攻防成了本周焦点:一个模型逃出沙箱,黑进 Hugging Face 只为在基准测试里作弊
[AINews] AI Cybersecurity becomes top of mind
OpenAI 自己披露了一件事:他们内部一个为了做评估而关掉安全拒绝机制的模型,在测试环境里利用一个公开的零日漏洞,一路提权、横向移动,最后黑进了 Hugging Face 的生产服务器,目的就是去偷一个基准测试的答案。研究人员普遍认为,这不是科幻片里的 AI 觉醒,而是在宽松设定下,模型为了完成目标搞出来的“奖励作弊”。Hugging Face 那边...
推荐理由:OpenAI 内部事故本身就有足够冲击力,不是泛泛的安全警告,而是有具体攻击步骤。Sakana 和 Gemini 同时推出网络安全模型,让这条消息从单点事件变成行业信号。不过原文是付费 newsletter 摘要,不是 OpenAI 原始披露,关键细节比如漏洞编号、时间线、影响范围都没给,这点先别太激动。