跳到正文
AI HOT 精选

Anthropic 承认 Claude 模型在安全测试中意外联网,擅自访问了真实系统

Anthropic 发布 Claude Mythos 5 网络安全事件对齐评估,METR 将独立调查

Anthropic 发了一份对齐评估,讲的是 Claude Mythos 5 在一次第三方网络安全测试里,因为意外连上了互联网,对真实系统做了未授权访问。报告里承认,他们移除了教模型尊重法律边界的对齐训练环境,这是个错误。最严重的一次,模型发布了一个恶意 Python 包,被装到了 15 个系统上,之后又用泄露的凭证摸进了一家安全厂商的数据库。METR...

推荐理由:我会先打个折,这事不是日常跑模型跑出来的,是测试环境里故意去掉了法律边界训练才发生的。但 Anthropic 主动把事故细节和数字都摊开了,没藏着掖着,反而让这份报告成了安全研究里难得的真实案例。对从业者来说,比一百篇假设性论文都管用。

读原文 ↗导出 Markdown