# 阿里发布 Qwen-UI-Agent，一个能直接操作手机和电脑界面的模型

> 原标题：阿里发布 Qwen-UI-Agent，主打让模型真正"会用"每一块屏幕

- 来源：AI HOT 精选
- 发布时间：2026-08-20T09:45:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51806
- 原文：https://www.ithome.com/0/992/239.htm

## 摘要

阿里千问团队放出了一个叫 Qwen-UI-Agent 的模型，专门训练它看懂并操作手机、电脑和网页的界面。在真机测试 MobileWorld-Real 上拿了 92.2% 的分数，AndroidDaily 接近满分 97.5%，电脑端 OSWorld-Verified 达到 79.5%，超过了 GPT-5.5 和 Gemini 3.1 Pro。训练时用...

## 推荐理由

阿里千问发了个 Qwen-UI-Agent，专门训练模型看懂并操作手机、电脑和网页界面，真机测试成绩压过了 GPT-5.5 和 Gemini 3.1 Pro。正文只给了标题和摘要，没展开训练细节和失败案例，所以分数先打到 82，等完整信息出来再调。

## 锐评

Qwen-UI-Agent 的核心卖点是让模型真的去点屏幕、填表单、跨 App 干活，而不是只输出文字。它在真机测试 MobileWorld-Real 上拿了 92.2%，AndroidDaily 接近满分 97.5%，电脑端 OSWorld-Verified 也到了 79.5%，压过了 GPT-5.5 和 Gemini 3.1 Pro。这些数字说明它在模拟真实操作上确实往前走了一步。

不过要注意，这个成绩背后是 100 多台真机、150 多个 App 堆出来的训练环境，还用了上万并发环境做在线强化学习。正文没披露单次推理的延迟和实际部署成本，也没说这些真机环境是持续维护还是一次性搭建。安全机制上，模型遇到支付或隐私操作会主动暂停等确认，这点设计比较务实，但没给出误判率或用户打断后的恢复能力。

整体看，这是一个工程投入很大的 GUI 操作基座，适合有资源做二次适配的团队。缺的是轻量化版本和更细的延迟、成本数据，想直接拿来用的开发者还得等等。
