# 复旦和通义搞了个 ToolCUA，专门教 Agent 在屏幕上选对工具

> 原标题：别光给Agent加Tool了，它根本选不明白！复旦×通义提出全新CUA训练范式

- 来源：量子位 · 公众号
- 发布时间：2026-05-31T05:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30869
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247893880&idx=3&sn=3801eccb44a75d9e72fc8da3c199f2a3

## 摘要

现在给 Agent 塞一堆工具，它经常不知道该点哪个。复旦和通义实验室提出了一套叫 ToolCUA 的训练方法，核心是用约 4000 个合成工具和 18 万步的“屏幕操作+工具调用”交叉轨迹来训练模型。他们训出来的 ToolCUA-8B 在 OSWorld-MCP 基准上跑到了 46.85% 的准确率。不过正文因为微信环境验证没抓到，具体训练细节和对比...

## 推荐理由

这篇文章抓了一个实际工程里的矛盾：工具越多，Agent 越不会选。我会先打个折，46.85% 的准确率不算高，但考虑到是 4k 工具的环境，这个数字说明问题确实难。18 万步合成轨迹是亮点，意味着训练数据不用全人工标，成本上友好一些。正文没披露推理延迟和实际部署的资源消耗，这点先别太激动。整体是一篇有痛点的研究发布，不是大模型或产品级发布，所以放在 featured 里合适。

## 锐评

这条研究解决了一个很实际的痛点：现在大家拼命给智能体加工具，但模型面对一堆按钮和菜单经常点错。复旦和通义实验室的思路不是继续堆工具，而是专门训练模型“怎么选工具”。他们造了约4000个合成工具，生成18万步的屏幕操作和工具调用交叉轨迹来训练，最终在OSWorld-MCP基准上把准确率拉到46.85%。这个数字本身不算高，但考虑到任务是在真实操作系统界面上完成多步操作，已经比之前的方法强不少。

不过这条新闻有个硬伤：微信环境验证把正文拦住了，我没看到具体训练细节、消融实验和对比基线。46.85%这个数字是ToolCUA-8B跑出来的，但不知道对比的其他模型是多少，也不知道这4000个合成工具覆盖了哪些场景。如果工具种类太窄，换到真实应用里可能掉得厉害。另外18万步轨迹听起来不少，但摊到4000个工具上，每个工具平均才45步，样本量偏薄。

还缺一个关键信息：这套方法对基座模型有没有要求。他们用的是8B参数模型，如果换成更小的模型或者不同架构，效果会不会崩？这些都得等论文放出来才能判断。
