跳到正文
AI HOT 精选

Anthropic 给 Claude Fable 5 的生物安全过滤器松了绑,误拦率砍掉约 85%

Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低

Anthropic 重写了 Fable 5 的生物安全分类器,把日常健康、教育类提问被误拦、降级到 Opus 5 的情况减少了大约 85%。之前为了防滥用,Fable 5 上线时几乎把所有生物相关提问都拦了,导致很多正常问题也被迫用更笨的模型回答。这次他们找了一帮内外部专家,重新梳理了分类器的判定规则,把无害用途从拦截范围里仔细抠了出来,再拿新规则训练...

推荐理由:Anthropic发了一篇官方安全更新,给出了85%这个具体的误报降低数字,并解释了做法——专家重写分类规则,把无害用途摘出来再训练。对关注AI安全部署细节的人有干货,也回应了用户之前抱怨正常问题被误拦的痛点,值得推荐。

读原文 ↗导出 Markdown