跳到正文
热点事件持续更新

AI拒绝机制的安全局限与代价

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月9日,MIT Technology Review结合研究与访谈,讨论将AI拒绝请求机制作为安全防护主要支柱的局限。报道指出,拒绝机制存在概率性失效、过度拒绝和隐蔽拒绝等问题,可能带来伤害、审查与失控风险。拒绝训练及外围分类器无法消除模型已有的危险能力,而收紧防护也会阻碍合法研究,并增加运行成本。Anthropic曾表示,一类分类器使聊天机器人的计算成本增加了24%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. MIT Technology Review · AI
    对 AI 拒绝请求能力的信任为何过度

    AI 的拒绝机制已成为安全防护的主要支柱,但其概率性失效、过度拒绝和隐蔽拒绝可能带来伤害、审查与失控风险。文章结合研究和访谈指出,拒绝训练及外围分类器无法消除模型已有的危险能力,收紧防护也会阻碍合法研究;Anthropic 曾表示,一类分类器使聊天机器人的计算成本增加了 24%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。