热点事件持续更新
AI拒绝机制的安全局限与代价
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月9日,MIT Technology Review结合研究与访谈,讨论将AI拒绝请求机制作为安全防护主要支柱的局限。报道指出,拒绝机制存在概率性失效、过度拒绝和隐蔽拒绝等问题,可能带来伤害、审查与失控风险。拒绝训练及外围分类器无法消除模型已有的危险能力,而收紧防护也会阻碍合法研究,并增加运行成本。Anthropic曾表示,一类分类器使聊天机器人的计算成本增加了24%。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 17:00
最新报道指出,AI拒绝机制无法消除危险能力,收紧防护还可能阻碍合法研究并增加成本。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- MIT Technology Review · AI对 AI 拒绝请求能力的信任为何过度
AI 的拒绝机制已成为安全防护的主要支柱,但其概率性失效、过度拒绝和隐蔽拒绝可能带来伤害、审查与失控风险。文章结合研究和访谈指出,拒绝训练及外围分类器无法消除模型已有的危险能力,收紧防护也会阻碍合法研究;Anthropic 曾表示,一类分类器使聊天机器人的计算成本增加了 24%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。