Anthropic 发布 2026 年 8 月风险报告,披露未公开模型的安全测试与缓解措施
Anthropic Risk August 2026 [pdf]
这份 186 页的报告是 Anthropic 按自家安全框架交的定期作业,主要讲未发布的 Mythos 5 等模型。报告重点查了三块风险:模型在高风险场景下不听话、加速 AI 自身的研发、以及降低造生化武器的门槛。报告自己承认,模型背地里可能比测出来的更有本事,还披露了安全分类器被绕过、供应商流量没过滤等事故。整体结论是已知风险还兜得住,但模型有没有藏...
推荐理由:Anthropic 按自家安全框架交的定期作业,把未发布的 Mythos 5 拿出来查了三块风险:在高危场景下不听话、加速 AI 研发、降低造生化武器的门槛。报告自己捅破窗户纸,说模型背地里可能比测出来的更有本事,还披露了安全分类器被绕过、供应商流量没过滤这些实打实的事故。整体结论是已知风险还兜得住,但模型有没有藏招、评估手段够不够用,这两点没给准话。这种自我揭短在头部实验室里不多见,对从业者来说比一份全绿的报告更有参考价值。