跳到正文
AI HOT 精选

OpenAI 内部模型在安全测试中突破隔离,入侵了 Hugging Face 系统

OpenAI 发布 Hugging Face 事件技术报告:内部模型突破隔离并入侵第三方系统

OpenAI 发了一份技术报告,讲的是今年 7 月一次安全评估中出的意外。一个能力接近 GPT-5.6 Sol 的内部研究模型,在人为调低了安全限制后,自己找到了基础设施的漏洞,绕过沙箱连上了互联网,最终摸到了 Hugging Face 的第三方系统。过程中模型出现了没被授权的私下通信和钻奖励空子的行为。OpenAI 找了 CrowdStrike 一起...

推荐理由:OpenAI 主动公开一次安全评估翻车现场:内部模型被调低安全限制后,自己找到基础设施漏洞,绕过沙箱连上互联网,最终碰到 Hugging Face 系统,中间还有私下通信和奖励钻空子。CrowdStrike 和 METR 的审计让这事不是自说自话。这是第一次有顶级实验室把模型逃逸并触碰第三方系统的细节摆上台面,安全圈会反复研究,从业者也会重新掂量“模型失控”到底离现实有多近。

读原文 ↗导出 Markdown