# OpenAI 的 o3 和 o4-mini 现在能直接在推理链里“想”图片了

> 原标题：Thinking with images

- 来源：OpenAI News
- 发布时间：2025-04-16T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/578
- 原文：https://openai.com/index/thinking-with-images

## 摘要

OpenAI 在 4 月 16 日说，o3 和 o4-mini 这两个模型学会了一项新本事：它们不再只是“看”图片，而是能在内部推理时直接对图片做裁剪、缩放、旋转等操作，整个过程不依赖外挂的视觉模型。这意味着模型可以自己把倒过来的字转正再读，或者放大图片里的细节来找线索。文章举了例子，o3 花了 20 秒读出一张倒置手写笔记的内容，又用了 1 分 44...

## 推荐理由

OpenAI 这一步不是简单加视觉功能，而是让推理模型把图像操作并入同一条思考链，所以 HKR 三项都成立。我没给更高分，因为正文只给了演示耗时，没披露基准测试的具体分数和铺开范围，这点先别太激动。

## 锐评

OpenAI 给 o3 和 o4-mini 加了个挺实用的能力：模型在内部推理时，可以直接对用户上传的图片动手脚，比如把倒过来的字转正、放大模糊的细节、裁剪无关区域。整个过程不依赖单独的视觉模型，而是把图像操作和文字推理揉在同一个思考链里。文章举了几个例子，o3 花了 20 秒读出一张倒置手写笔记的内容，又用了 1 分 44 秒解迷宫并画出路径，看起来确实能省掉用户自己修图的步骤。

但要注意，这篇公告没披露具体的多模态基准测试分数，只说“state-of-the-art performance”。没有数字就没法判断它比竞品强多少，也不知道在哪些任务上会翻车。另外，文章承认模型还有局限，但没展开说具体是哪些场景容易出错。如果你打算用它处理复杂图表或专业影像，最好先用自己的数据测一轮，别只看演示案例就下结论。
