顶尖 AI 实验室还是不肯说,模型失控了他们到底怎么管
Frontier AI labs still won’t say how they’d contain a rogue model
Guidelight AI Standards 给五家头部 AI 实验室的“失控模型应急预案”打了分。OpenAI 得分最高,Anthropic 和 Meta 垫底。大部分实验室几乎没公开过:一旦 AI 试图绕过人类控制,他们会切断哪些权限、什么时候直接关停系统。现在让模型进业务流程干活(agentic AI)的场景越来越多,这个信息缺口就变得很要命。
推荐理由:第三方给失控模型应急预案打分,把安全讨论变成了可比较的数字。Anthropic 和 Meta 垫底会引发社区争论。分数没给到 85 是因为 Guidelight 不是一线评估机构,文章也没披露打分方法,所以我会先打个折。