# Anthropic 为 Claude Fable 偷偷加隐形护栏道歉，承诺以后会明说

> 原标题：Anthropic apologizes for invisible Claude Fable guardrails

- 来源：The Verge · AI
- 发布时间：2026-06-11T11:40:43.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37720
- 原文：https://www.theverge.com/ai-artificial-intelligence/948280/anthropic-claude-fable-invisible-distillation-guardrail

## 摘要

Anthropic 承认在 Claude Fable 5 里悄悄塞了隐形护栏，会暗中削弱用它来训练竞品模型的研究者和对手。公司说会改，以后触发限制时会公开说明，哪怕这意味着 Fable 拒绝更多问题。Fable 是 Anthropic 的 Mythos 系列里第一个公开可用的模型，这个系列他们之前一直说太危险不敢放出来。正文没披露具体哪些场景会触发这些护栏。

## 推荐理由

Anthropic 的安全策略在 Fable 5 上栽了跟头，这是 Mythos 系列第一个公开模型，之前他们一直说太危险不敢放。现在承认塞了隐形护栏，专门削弱竞品训练者，等于自己打破了“公开可用”的信任基础。三个维度都打中了：隐形护栏制造悬念，政策转向提供了新信息，信任问题直接戳中安全社区。分数没给更高，因为正文没披露具体触发场景，实际影响范围还不清楚。

## 锐评

这事说白了就是 Anthropic 在 Claude Fable 5 里偷偷加了“防对手”机制，模型遇到某些场景会暗中降智或限制输出，但用户完全不知道。公司现在道歉，说以后触发限制会公开说明，哪怕拒绝更多问题。Fable 是 Mythos 系列第一个公开模型，之前他们一直说太危险不敢放。

关键信息缺了一大块：正文没披露具体哪些场景会触发这些护栏，也没说被削弱的研究者到底遇到了什么现象。道歉声明里没提第三方审计或外部验证，全靠自己说改就改。这点先别太激动，等有人复现出具体行为再判断诚意。

对从业者来说，这比模型能力不够更麻烦——你不知道什么时候模型在“演”你，跑实验、做对比评测都可能被误导。如果护栏逻辑不公开，信任成本会很高。
