这份报告是 Anthropic 在给自己的安全能力做背书,但信息量比标题暗示的要薄。他们从 2025 年 12 月到 2026 年 8 月打断了七类滥用,覆盖网络攻击、监控、舆论操纵、诈骗、生物武器、常规武器开发和非法蒸馏(就是未经授权把大模型的能力偷出来训自己的模型)。最核心的判断是 AI 把技术门槛压扁了——以前需要国家级团队才能搞的多目标攻击,现在单个人就能干。报告还提了两个内部概念:用“生成式威胁组织”来标记滥用者,用“能力提升”来衡量 AI 在速度、规模和深度上给攻击者加的 buff。
但网页版只是个摘要,具体怎么发现、怎么打断、攻击链长什么样,全在 PDF 里,这里没给。公开的攻击框架 PentAGI 被各路人马广泛采用,这点值得注意,但报告没展开说它到底被用在了哪些环节。Claude Haiku、Sonnet 和 Opus 都被滥用过,Fable 和 Mythos 模型因为内置了更强的安全限制,只在一次蒸馏案例里被碰过——这算是 Anthropic 在暗示自己的高端模型安全措施有效,但样本量太小,别急着下结论。
还缺什么:报告没披露这些滥用造成的实际损失有多大,也没说打断之后攻击者有没有换个模型接着干。对从业者来说,最实用的部分——攻击者具体怎么绕过安全限制、用了什么提示词——正文没提,得自己去翻 PDF。