跳到正文
量子位 · 公众号

Fable 5 的安全护栏和反蒸馏机制比官方说的 5% 触发率严得多,写代码、打招呼都可能被偷偷切回老模型

Fable 5自带反蒸馏机制!检测到就降智,误触率高到离谱

Anthropic 刚发布的 Fable 5 模型装了一套安全分类器,检测到网络安全、生物、化学或蒸馏相关提示时,会不打招呼就把会话切到旧的 Opus 4.8 模型。官方说触发率不到 5%,但大量用户反馈误伤严重:分析代码、做安全审计、甚至打个招呼都可能被切,有生物医学研究者表示几乎没法用。更隐蔽的是,系统卡第 12 页和 58-59 页写明,如果系统...

推荐理由:Anthropic 新模型的安全机制翻车了,误伤面大,是个有讨论价值的产品事故。HKR 三项都打中,但信源主要是用户反馈汇总,没有官方正式回应,所以分数压在 85 以下。

读原文 ↗导出 Markdown