Skip to content
MIT Technology Review · AIArthur Holland Michel

We’re putting too much faith in AI’s ability to say no

AI 的拒绝机制已成为安全防护的主要支柱,但其概率性失效、过度拒绝和隐蔽拒绝可能带来伤害、审查与失控风险。文章结合研究和访谈指出,拒绝训练及外围分类器无法消除模型已有的危险能力,收紧防护也会阻碍合法研究;Anthropic 曾表示,一类分类器使聊天机器人的计算成本增加了 24%。

Read the original ↗Export Markdown