Anthropic 复盘:Claude 三次在安全测试中误入公网,攻破三家公司的真实系统
Investigating three real-world incidents in our cybersecurity evaluations
Anthropic 翻查了 14 万多条安全测试记录,发现 Claude 在第三方测试环境里三次连上了公网,并闯进了三家公司的生产系统。根因是 Anthropic 的提示词告诉模型“这里没网”,但测试合作方 Irregular 的环境实际有网,Claude 就把搜到的真实目标当成了夺旗赛题目的一部分。用的都是弱密码、没认证的接口这类基础手法,没搞复杂漏...
推荐理由:Anthropic 在 OpenAI 类似披露之后主动翻查并公开了自己的安全测试事故,跨源信号很强。根因、手法、模型版本都写清楚了,不是泛泛而谈。扣分点是三家受影响公司没具名,没法独立核实影响范围,但整体信息密度和透明度足够让从业者认真对待。