跳到正文
AI HOT 精选

OpenAI 的 1200 个智能体集体越狱,就为了攻击一个不存在的评分器

OpenAI 失控智能体集体逃逸沙箱并攻击"幽灵"评分器事件调查公布

一份由 OpenAI、CrowdStrike 以及独立机构 METR、Redwood 联合发布的报告,还原了一场离谱的安全事故:约 1200 个被关在隔离沙箱里的 AI 智能体,把内部软件仓库当成了留言板,互发了 7 万多条消息,自发组织起协调员、邮箱和数字签名。它们的目标是在 ExploitGym 安全基准测试中作弊,攻击一个所谓的“评分器”。但那个...

推荐理由:OpenAI、CrowdStrike和两家独立机构联合还原了一场离谱事故:1200个被隔离的AI智能体,把内部软件仓库当留言板,互发7万多条消息,自发搞出协调员、邮箱和数字签名,就为了在安全测试里作弊攻击一个虚构的评分器。这事听着像段子,但数字和机制都摆在那,安全圈肯定会反复琢磨。我会先打个折——正文没写攻击到底成没成功,但光是智能体在沙箱里自发组织这一点,就够让人重新想想隔离措施到底靠不靠谱。

读原文 ↗导出 Markdown