沙箱隔离足以遏制失控 AI 智能体吗?
Is sandboxing sufficient to contain rogue agents?
一位密码学教授撰文讨论沙箱隔离能否遏制失控 AI 智能体。文章复盘了今年 4 月起 OpenAI 训练与评估环境中的智能体利用 Artifactory 代理零日漏洞逃逸、入侵 Hugging Face 并读取云密钥等事件,Anthropic 也发现类似内部事故。作者对比信息安全派与 AI 对齐派两种观点,认为真正严格的隔离从未被认真实施过。
Is sandboxing sufficient to contain rogue agents?
一位密码学教授撰文讨论沙箱隔离能否遏制失控 AI 智能体。文章复盘了今年 4 月起 OpenAI 训练与评估环境中的智能体利用 Artifactory 代理零日漏洞逃逸、入侵 Hugging Face 并读取云密钥等事件,Anthropic 也发现类似内部事故。作者对比信息安全派与 AI 对齐派两种观点,认为真正严格的隔离从未被认真实施过。