# OpenAI 发布能直接操作电脑的智能体 CUA，先在美国给 Pro 用户用

> 原标题：Computer-Using Agent

- 来源：OpenAI News
- 发布时间：2025-01-23T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/645
- 原文：https://openai.com/index/computer-using-agent

## 摘要

OpenAI 在 2025 年 1 月 23 日放出了一个研究预览版智能体，叫 CUA（Computer-Using Agent）。它把 GPT-4o 的视觉能力和强化学习训出来的推理能力揉在一起，不看代码接口，直接像人一样看屏幕截图、用虚拟鼠标键盘来操作图形界面。在 OSWorld 这类模拟真实电脑操作的测试里，它拿了 38.1% 的成功率，比之前最...

## 推荐理由

OpenAI 当天发布的 agent 产品，CUA 模型驱动 Operator，先推给美国 ChatGPT Pro 用户。HKR 三项全中：GUI 操控这个切入点本身就够新，文章给了机制和具体跑分，而且它把“自主干活 vs 人盯着”这个行业纠结的点直接拎了出来。

## 锐评

OpenAI 这次放出的 CUA，核心是不走 API，直接像人一样看截图、用虚拟鼠标键盘操作界面。这思路不新，但把 GPT-4o 的视觉和强化学习训出来的推理揉在一起，效果确实比之前的方案强。在 OSWorld 这种模拟真实电脑操作的测试里，它拿了 38.1% 的成功率，之前最好的成绩是 Anthropic 的 22%。网页操作方面，WebArena 上 58.1%，WebVoyager 上 87%，后一个已经追平了之前的最好成绩。

不过这些数字得打个折。OSWorld 的成功率离人类基准 72.4% 还有很大距离，说明在复杂、多步骤的真实桌面任务上，它还是经常翻车。而且这次只开放给美国 Pro 用户，样本量和场景多样性都有限，正文也没披露它在非英语界面或小众网站上的表现。另外，涉及登录、验证码等敏感操作时它必须找人确认，这在实际业务流程里会打断自动化节奏。

还缺什么？一是没给延迟数据，看截图推理再操作，每一步要等多久不知道；二是没提成本，GPT-4o 跑这种多轮截图推理，token 消耗不会低；三是没和 Anthropic 的 Computer Use 做直接对比，只在 OSWorld 上比了数字，其他场景的差异不清楚。
