# OpenAI 把图像生成直接塞进了 GPT-4o，能边聊边改图，文字也终于不崩了

> 原标题：Introducing 4o Image Generation

- 来源：OpenAI News
- 发布时间：2025-03-25T11:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/595
- 原文：https://openai.com/index/introducing-4o-image-generation

## 摘要

3 月 25 号，OpenAI 把新的图像生成功能做进了 GPT-4o 模型里，不再是外挂一个单独的画图工具。核心变化是模型直接学了图片和文字的联合分布，走的是“文本 token → transformer → 扩散模型 → 像素”这条管线，所以它能读懂上下文，也能在聊天里多轮改图，保持角色、风格一致。最实用的提升是文字渲染：路牌、菜单、邀请函上的字终...

## 推荐理由

这次更新把图像生成直接塞进 GPT-4o 本体，不是接个 DALL·E 插件。核心看点不是画得有多美，而是两点：一是文字渲染准不准，二是多轮改图能不能保持一致性——比如改完背景，人物别跟着变脸。正文给了机制线索，transformer 先理解意图，diffusion 再出像素，中间有联合训练撑着，但没给具体架构和训练数据量。示例里反复出现 best of 1 和 best of ~8，说明模型内部会多采样再挑图，实际出图质量可能比单次采样稳，但延迟和算力成本也会上去。价格、API 开放时间和调用配额正文都没提，这点先别太激动。整体看，这是一次把多模...

## 锐评

这条更新真正的信号是：OpenAI 不再把画图当成一个独立功能，而是让模型直接学图片和文字的联合分布，走“文本 token → transformer → 扩散模型 → 像素”这条管线。好处是模型能理解聊天上下文，多轮改图时角色、风格能保持一致，不像以前换个姿势就换张脸。最实用的提升是文字渲染——路牌、菜单、邀请函上的字终于能写对了，这对做海报、传单的人来说是刚需。

不过得打个折。官方展示的例子里标了“best of 1”、“best of ~8”或“best of 8”，说明不是每次都能一次出好图，实际用起来可能要抽卡。另外正文完全没提价格、API 开放时间、调用配额这些关键信息，开发者想接入还得等。安全措施也只说了有 C2PA 元数据和内部检测工具，具体怎么拦敏感内容没展开。

整体看，这次更新把画图从“玩具”往“工具”推了一步，但离稳定可用的生产工具还差一口气——一致性、成本、开放程度都还是未知数。
