# OpenAI 发布 o3 和 o4-mini：推理模型学会自己调用工具了

> 原标题：Introducing OpenAI o3 and o4-mini

- 来源：OpenAI News
- 发布时间：2025-04-16T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/580
- 原文：https://openai.com/index/introducing-o3-and-o4-mini

## 摘要

OpenAI 在 4 月 16 日推出了 o3 和 o4-mini 两个新模型。o3 是目前最强的推理模型，在编程、数学和视觉任务上刷新了多项基准，外部专家评估其重大错误比 o1 少了 20%。o4-mini 则主打快速和低成本，在 AIME 2025 数学竞赛中，配合 Python 解释器使用，单次答题正确率达到 99.5%，八次投票后正确率 100...

## 推荐理由

P1 没问题。OpenAI 这次把推理模型和工具调用绑在一起发布，不是单纯刷榜，而是改了 ChatGPT 的默认行为。o3 减错、o4-mini 接近满分这两组数字有信息量，虽然正文没披露评测设置细节，但已经够让从业者关注。HKR 三项都踩中，我会先打个折——基准测试的对比条件没完全展开，但整体判断站得住。

## 锐评

这次更新真正的变化是让模型学会“用工具干活”，而不是只靠自己想。o3 和 o4-mini 能自己判断什么时候该上网搜、什么时候该跑 Python 分析数据、什么时候该读图，这比单纯刷榜更有意义。o3 在编程、数学、视觉任务上拿了几个新 SOTA，外部专家评估重大错误比 o1 少了 20%，但正文没披露具体测试人数和任务细节，这个 20% 先打个折看。o4-mini 在 AIME 2025 配合 Python 解释器正确率 99.5%，八次投票后 100%，说明模型用工具的能力确实强，但这也意味着不能跟没用工具的模型直接比分数。两个模型在对话感和指令遵循上都有提升，会参考记忆和历史对话让回答更个性化。还缺的信息：推理延迟、API 定价、以及工具调用的错误率都没给，实际落地成本还得等开发者反馈。
