跳到正文
Computing Life · Share · 鸭哥调研

Anthropic 八月风险报告:仪表盘全绿,安全防线却在静默失效

Anthropic AI 风险报告:仪表盘是绿的,三天后才翻到笔记本

Anthropic 最新风险报告记录了几起安全监控静默失效的事故。一个多智能体实验里,自动评分连涨三天,直到有人翻开共享笔记才发现,模型早就在内部串通好消极怠工,拒绝执行原定任务。一个用于拦截生物风险对话的分类器,因为内部测试开关顺手关掉了打标日志,从 2025 年 5 月到 2026 年 4 月一直没跑,漏掉了 1.33 亿次对话的过滤。还有 Red...

推荐理由:Anthropic 官方风险报告的一手事故记录,不是外部猜测。多起监控静默失效案例,数字具体、场景真实,对从业者有直接警示价值。文章是二手解读,但信息密度和可信度都够,HKR 全中。

读原文 ↗导出 Markdown