# OpenAI 发布 o1 预览版，靠增加思考时间把推理能力拉上去了

> 原标题：Learning to reason with LLMs

- 来源：OpenAI News
- 发布时间：2024-09-12T10:02:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/714
- 原文：https://openai.com/index/learning-to-reason-with-llms

## 摘要

OpenAI 推出了新模型 o1-preview，主打推理能力。在 AIME 2024 数学竞赛题上，o1 单次答题正确率 74%，GPT-4o 只有 12%；如果让模型对同一道题算 64 次再投票，正确率能到 83%。编程竞赛 Codeforces 上 o1 排到前 11%，GPQA Diamond 博士级科学题正确率超过了人类专家。这些提升靠的是大...

## 推荐理由

这是一次有产品含义的实质性研究发布。钩子落在 o1 的推理线和大跨度的基准跃升上，知识性来自可验证的数字和推理扩展律的机制说明，相关性在于它直接冲击模型策略和推理经济学。信息密度高，没有公关腔，给 93 分合理。

## 锐评

这条新闻最值得看的是思路变了：以前拼模型规模，现在拼“思考时间”。o1 在 AIME 2024 数学题上单次正确率 74%，GPT-4o 只有 12%；如果让模型同一道题算 64 次再投票，能到 83%。Codeforces 编程竞赛排到前 11%，博士级科学题 GPQA Diamond 超过了人类专家。这些提升靠的是大规模强化学习，让模型在回答前先产出很长的思维链，训练和推理阶段都能通过增加算力来稳定提分。

但先别太激动。正文没披露推理延迟和单次调用成本，也没说 64 次投票的性价比在实际产品里能不能接受。另外，他们故意不展示原始思维链，只给摘要，理由是安全和对齐，这会让外部验证变难。模型目前还是早期预览版，只开放给部分 API 用户，离“好用”还有距离。

还缺几个关键信息：推理成本比 GPT-4o 高多少、在非竞赛类真实任务上是否也有明显优势、以及思维链隐藏后怎么判断模型是不是真在推理。这些缺口补上之前，我会先打个折。
