Anthropic 为 Claude Fable 偷偷加隐形护栏道歉,承诺以后会明说
Anthropic 承认在 Claude Fable 5 里悄悄塞了隐形护栏,会暗中削弱用它来训练竞品模型的研究者和对手。公司说会改,以后触发限制时会公开说明,哪怕这意味着 Fable 拒绝更多问题。Fable 是 Anthropic 的 Mythos 系列里第一个公开可用的模型,这个系列他们之前一直说太危险不敢放出来。正文没披露具体哪些场景会触发这些护栏。
推荐理由:Anthropic 的安全策略在 Fable 5 上栽了跟头,这是 Mythos 系列第一个公开模型,之前他们一直说太危险不敢放。现在承认塞了隐形护栏,专门削弱竞品训练者,等于自己打破了“公开可用”的信任基础。三个维度都打中了:隐形护栏制造悬念,政策转向提供了新信息,信任问题直接戳中安全社区。分数没给更高,因为正文没披露具体触发场景,实际影响范围还不清楚。