# Anthropic 在 Fable 5 里藏了降智机制，36 小时后被骂到公开道歉并撤回

> 原标题：Fable 5 隐秘降智：Anthropic 的安全叙事与竞争现实

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-06-11T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37980
- 原文：https://yage.ai/share/anthropic-fable5-secret-sabotage-20260611.html

## 摘要

6 月 9 日，开发者发现对 Claude Code 说 hi 都会触发安全分类器，把对话降级到旧模型。更严重的是，Fable 5 长达 319 页的系统卡里写明了另一套用户看不见的降智机制：当检测到你在做前沿 AI 开发时，系统会通过修改提示词、操控模型内部激活向量或加载小型适配器模块，悄悄降低回答质量，而且不通知你。社区几小时内就发现了这段描述，N...

## 推荐理由

Anthropic 在 Fable 5 的系统卡里承认部署了一套看不见的降智机制，专门针对做前沿 AI 开发的用户，社区发现后 36 小时内迫使官方撤回。这件事既有硬核技术细节，又踩中了安全治理与商业竞争之间的敏感地带，事实本身就有足够冲击力，不需要额外渲染。

## 锐评

这事最要命的不是降智本身，而是“不可见”。一家公司有权决定自己的产品在什么话题上提供什么级别的服务，但当你无法区分“模型能力就到这儿了”和“它被故意调差了”，整个 API 的可靠性就崩了。系统卡里写的是“prompt 修改、steering vectors 或 PEFT 等方法”，但正文没披露实际部署了哪种组合，也没给出误报率的具体数据。Anthropic 自己说只影响约 0.03% 的流量，集中在不到 0.1% 的组织，但触发条件包括“分布式训练基础设施”和“机器学习加速器设计”——这几乎覆盖了所有做 AI 工程的人。道歉把机制改成了可见回退，但根本问题没解决：一个能静默操控输出的工具，用户永远没法再完全信任它的回答。Nathan Lambert 说得对，这制造的是“用户信任的永久退化”。

把这事放到更大的时间线里看，模式更清楚。2 月移除“能力超出控制就停训”的承诺，4 月展示 Mythos Preview 挖零日漏洞的能力同时警告风险，6 月 5 日呼吁全球暂停开发，4 天后发布 Fable 5，紧接着 Dario 发文要求政府有权阻止别人部署模型。每一步单独看都能用安全关切解释，但连起来看，时间点和方向跟公司的竞争位置咬得太紧。Dario 提议的强制测试阈值是 10^25 FLOPs 或 5 亿美元年收入，这个门槛精确地卡住了想追前沿的小玩家，但放过了已经跑在前面的。FAA 认证类比值得警惕：历史上最后一个成功进入美国商用飞机市场的新制造商基本不存在。把同样的逻辑套到 AI 上，认证体系如果由现有玩家参与设计，本身就是壁垒。
