# OpenAI 发现：让 o1 系列模型多想一会儿，对抗攻击成功率会大幅下降

> 原标题：Trading inference-time compute for adversarial robustness

- 来源：OpenAI News
- 发布时间：2025-01-22T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/649
- 原文：https://openai.com/index/trading-inference-time-compute-for-adversarial-robustness

## 摘要

OpenAI 发了篇新论文，核心结论是：给 o1-preview 和 o1-mini 这类推理模型更多的“思考时间”（也就是推理时计算量），它们对对抗攻击的防御力会明显变强，很多攻击的成功率能降到接近零。他们测了数学题、SimpleQA 的提示注入、Attack Bard 的对抗图片，还有 StrongREJECT 的越狱提示词。结果发现，攻击者投入的...

## 推荐理由

我会先打个折：OpenAI 自己在标题里写了“初步证据”，正文也没完整披露哪些情况下防御会失效，所以别当成熟方案看。但这条思路确实值得盯——不靠对抗训练，而是让模型多想一会儿来扛住没见过的攻击，在数学题、提示注入、滥用提示这几类测试里都看到了攻击成功率大幅下降。如果后续能确认成本和失效边界，对安全部署会是个挺省钱的方向。

## 锐评

这篇论文的核心发现挺直接：给 o1-preview 和 o1-mini 更多推理时间，它们面对对抗攻击的防御力会明显提升。在数学题、SimpleQA 的提示注入、Attack Bard 的对抗图片和 StrongREJECT 越狱测试中，很多攻击成功率随着模型“思考”量增加直接降到接近零。

这个结论有意思的地方在于，它没走传统对抗训练的老路，纯粹靠推理阶段多烧算力换安全。但得注意，OpenAI 自己把话说得很保守，标题就用了“初步证据”。论文里也明确写了存在例外情况，有些场景下加算力没用，正文没完全披露所有失败案例。

还缺什么？一是没看到和 Claude 等竞品的横向对比，二是没给出这种防御方式的具体算力成本——让模型多想几秒到底要多花多少钱，这对实际部署很关键。另外，攻击者如果专门针对这种“思考型”防御设计新攻击手法，效果会不会打折，论文也没展开。
