# OpenAI 发布 GDPval：用 44 种职业的真实工作成果来考模型

> 原标题：Measuring the performance of our models on real-world tasks

- 来源：OpenAI News
- 发布时间：2025-09-25T09:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/457
- 原文：https://openai.com/index/gdpval

## 摘要

OpenAI 搞了一个新评测集叫 GDPval，专门看模型在真实工作里到底能不能干活。它从对美国 GDP 贡献最大的 9 个行业里挑了 44 种职业，让平均从业 14 年以上的老手出了 1320 道题，其中 220 道金牌题已经开源。题目不是考试卷，而是直接让你产出法律简报、工程图纸、护理计划这类真实交付物，格式涵盖文档、幻灯片、表格、图表和多媒体。评...

## 推荐理由

OpenAI 这次拿出的 GDPval 不是又一个刷榜基准，而是把评测对象换成了真实工作交付物，这点本身就抓人。文章给了具体数字和限制条件，比如 44 个职业、1320 个任务、220 个金标开源，也明确说了只测单轮，不碰多轮和长上下文，信息量够。它踩中的是行业最关心的问题：模型离真正接手知识工作还有多远。不是模型发布或高管变动，放在 featured 刚好。

## 锐评

OpenAI 这次没搞考试题，而是让平均从业 14 年以上的老手出了 1320 道真实工作题，覆盖 44 种职业，比如写法律简报、画工程图纸、做护理计划。题目直接要求产出文档、幻灯片、表格这些真实交付物，220 道金牌题已经开源。这个思路比刷榜有意义，因为它看的是模型能不能顶半个员工，而不是考试能考几分。

但限制也很明显。正文明确说只测 one-shot，也就是给一次指令就让模型出活，不测迭代修改、不测跟人配合的 workflow。现实工作里反复改稿、对齐需求才是常态，单次产出只能算个入门分。另外，评分怎么做的、人工评还是模型评、一致性怎么样，正文没细说。1320 道题看着不少，摊到 44 个职业上每个也就 30 道，覆盖面有限。

还缺什么：没给不同职业的得分明细，也没说这些题对国内工作场景有多大参考价值。建议等开源题跑一遍自己的模型再下判断。
