OpenAI 发现:让 o1 系列模型多想一会儿,对抗攻击成功率会大幅下降
OpenAI 发了篇新论文,核心结论是:给 o1-preview 和 o1-mini 这类推理模型更多的“思考时间”(也就是推理时计算量),它们对对抗攻击的防御力会明显变强,很多攻击的成功率能降到接近零。他们测了数学题、SimpleQA 的提示注入、Attack Bard 的对抗图片,还有 StrongREJECT 的越狱提示词。
推荐理由:OpenAI 测试了 o1-preview 和 o1-mini 在数学题、提示注入、对抗图片和越狱提示词上的表现,增加推理时计算量后攻击成功率大幅下降。