# OpenAI 发布 GPT-5.2，在专业任务和长时间跑流程的智能体上又往前迈了一步

> 原标题：Introducing GPT-5.2

- 来源：OpenAI News
- 发布时间：2025-12-11T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/343
- 原文：https://openai.com/index/introducing-gpt-5-2

## 摘要

OpenAI 推出了 GPT-5.2，主要卖点是处理专业工作（做表格、写代码、读图、理解长文档）和让模型在业务流程里干活的能力更强了。在衡量 44 种职业任务的 GDPval 测试里，GPT-5.2 Thinking 版在 70.9% 的对比中赢了或打平了行业专家，而且生成速度是专家的 11 倍以上，成本不到 1%。代码方面，SWE-Bench Pro...

## 推荐理由

官方来源加上旗舰模型更新，H 和 R 都拉满，进 featured 没问题。但 K 完全挂掉——正文空荡荡，所有关键参数都欠奉，所以分数没给到顶。真正该盯的是后续的 API 文档和定价页，现在只能先打个折。

## 锐评

OpenAI 发了 GPT-5.2，主推两个点：处理专业工作（做表、写代码、读图、啃长文档）和让模型在业务流程里干活。最抓眼球的数字来自 GDPval 测试——这个测试覆盖了 44 种职业，GPT-5.2 Thinking 版在 70.9% 的对比中赢了或打平了行业专家，而且生成速度是专家的 11 倍以上，成本不到 1%。代码方面，SWE-Bench Pro 从 50.8% 提到 55.6%，抽象推理 ARC-AGI-2 从 17.6% 跳到 52.9%，提升明显。

但得打个折。GDPval 是 OpenAI 自己设计的基准，题目是“定义清晰的知识工作”，跟真实职场里需求模糊、来回扯皮的任务不是一回事。正文也没说模型规模、上下文窗口、API 定价和具体上线范围，只说今天开始推送给付费用户。另外，那些合作方的好评都是定性描述，没有独立第三方的对照数据。

还缺什么：多语言能力没提，幻觉率没给，安全测试只列了标题没展开。想判断它是不是真能替人干活，得等有人拿它跑一遍真实业务场景再说。
