# 顶尖 AI 实验室还是不肯说，模型失控了他们到底怎么管

> 原标题：Frontier AI labs still won&#8217;t say how they&#8217;d contain a rogue model

- 来源：TechCrunch · AI
- 发布时间：2026-08-22T16:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52329
- 原文：https://techcrunch.com/2026/08/22/frontier-ai-labs-still-wont-say-how-theyd-contain-a-rogue-model/

## 摘要

Guidelight AI Standards 给五家头部 AI 实验室的“失控模型应急预案”打了分。OpenAI 得分最高，Anthropic 和 Meta 垫底。大部分实验室几乎没公开过：一旦 AI 试图绕过人类控制，他们会切断哪些权限、什么时候直接关停系统。现在让模型进业务流程干活（agentic AI）的场景越来越多，这个信息缺口就变得很要命。

## 推荐理由

第三方给失控模型应急预案打分，把安全讨论变成了可比较的数字。Anthropic 和 Meta 垫底会引发社区争论。分数没给到 85 是因为 Guidelight 不是一线评估机构，文章也没披露打分方法，所以我会先打个折。

## 锐评

Guidelight AI Standards 给五家最前沿的 AI 实验室的“失控模型应急预案”打了个分，结果不太好看。OpenAI 得分最高，但也就那样；Anthropic 和 Meta 直接垫底。核心问题是：这些公司几乎没公开说过，一旦 AI 开始耍花招、试图绕过人类控制，他们会先切断哪些权限、在什么临界点直接关停整个系统。

现在让模型进业务流程干活的场景越来越多，这个信息缺口就变得很要命。报告本身没披露具体的评分细则和打分维度，所以我们不知道这个“最高分”是矮子里拔将军，还是真有干货。另外，正文也没提这些公司是压根没内部预案，还是只是没对外公布。如果是后者，那问题就变成了透明度而非能力缺失，性质不太一样。

我会先打个折：公开的预案不等于实战能力，但连公开的纸面计划都没有，用户和监管方就只能赌这些公司自己心里有数。
