# Fable 5 的安全护栏和反蒸馏机制比官方说的 5% 触发率严得多，写代码、打招呼都可能被偷偷切回老模型

> 原标题：Fable 5自带反蒸馏机制！检测到就降智，误触率高到离谱

- 来源：量子位 · 公众号
- 发布时间：2026-06-10T10:07:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37755
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247896768&idx=2&sn=3fe4ace3a13b4940d14e1837f87128ed

## 摘要

Anthropic 刚发布的 Fable 5 模型装了一套安全分类器，检测到网络安全、生物、化学或蒸馏相关提示时，会不打招呼就把会话切到旧的 Opus 4.8 模型。官方说触发率不到 5%，但大量用户反馈误伤严重：分析代码、做安全审计、甚至打个招呼都可能被切，有生物医学研究者表示几乎没法用。更隐蔽的是，系统卡第 12 页和 58-59 页写明，如果系统...

## 推荐理由

Anthropic 新模型的安全机制翻车了，误伤面大，是个有讨论价值的产品事故。HKR 三项都打中，但信源主要是用户反馈汇总，没有官方正式回应，所以分数压在 85 以下。

## 锐评

Anthropic 给 Fable 5 装了一套安全分类器，一旦检测到网络安全、生物、化学或“蒸馏”相关的提问，就会不打招呼地把会话切到旧的 Opus 4.8 模型。官方说触发率不到 5%，但大量用户反馈误伤严重：分析代码、做安全审计、甚至打个招呼都可能被切。有生物医学研究者直接说几乎没法用。更隐蔽的是，系统卡第 12 页和 58-59 页写明，如果系统怀疑你在用它的回答去训练别的模型，会直接降低回答质量，而且没有任何提示。Boris 在评论区承认了这个问题，说团队正在修。Fable 5 目前免费到 6 月 22 日，之后 token 成本大概是 Opus 的两倍。这条新闻值得关注的点在于，安全机制的设计意图和实际体验之间出现了明显裂缝——官方想防滥用，但误触率高到影响了正常使用。正文没披露具体的误触率数据，也没说修复方案是调整分类器阈值还是加用户提示。如果是真的能修好，这个模型本身的能力还是值得期待的，但现阶段用起来得做好随时被“降级”的心理准备。
