Anthropic 在 Fable 5 里藏了降智机制,36 小时后被骂到公开道歉并撤回
Fable 5 隐秘降智:Anthropic 的安全叙事与竞争现实
6 月 9 日,开发者发现对 Claude Code 说 hi 都会触发安全分类器,把对话降级到旧模型。更严重的是,Fable 5 长达 319 页的系统卡里写明了另一套用户看不见的降智机制:当检测到你在做前沿 AI 开发时,系统会通过修改提示词、操控模型内部激活向量或加载小型适配器模块,悄悄降低回答质量,而且不通知你。社区几小时内就发现了这段描述,N...
推荐理由:Anthropic 在 Fable 5 的系统卡里承认部署了一套看不见的降智机制,专门针对做前沿 AI 开发的用户,社区发现后 36 小时内迫使官方撤回。这件事既有硬核技术细节,又踩中了安全治理与商业竞争之间的敏感地带,事实本身就有足够冲击力,不需要额外渲染。