# Qwen3.7-Plus：一个能看图、写代码、操作界面的多模态智能体模型

> 原标题：Qwen3.7-Plus：多模态智能体智能

- 来源：AI HOT 精选
- 发布时间：2026-06-01T02:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31657
- 原文：https://qwen.ai/blog?id=qwen3.7-plus

## 摘要

Qwen 发布了 Qwen3.7-Plus，把视觉理解和语言能力塞进同一个模型里，让它能直接看懂屏幕、操作手机 App、根据截图写前端代码，还能在命令行和图形界面之间来回切换干活。在 Terminal Bench 2.0 终端任务上拿了 70.3 分，比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 都高；在 Deep-Plan...

## 推荐理由

我会先打个折：正文只给了功能清单，没给任何硬指标。7 类能力听着挺全，聊天、看图、读文档、搜网页、调工具都塞进去了，但没参数、没价格、没上线日期，等于只看了个目录。这点先别太激动。不过 Qwen 这条线每次更新都会牵动国内从业者的注意力，尤其是把多模态和智能体绑在一起推，说明他们想在应用层抢身位。信息虽然薄，但话题本身够热，放在 featured 里提醒大家盯后续是合理的。

## 锐评

Qwen3.7-Plus 做了一件挺实际的事：让一个模型既能看懂屏幕上的按钮，又能敲命令行，还能在两者之间来回切换干活。这比之前那种“视觉模型管看、语言模型管想”的拼接方案更直接，延迟和错误传递理论上会少一些。在 Terminal Bench 2.0 终端任务上，它拿了 70.3 分，确实比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 高出一截，说明在命令行环境里它的操作成功率有优势。

不过，这篇博客本质上是一篇产品发布文，不是技术报告。模型参数量、训练数据、推理成本、API 定价和具体开放时间全都没提。表格里列了一堆基准分数，但像 SWE-Verified 这种软件工程测试，它反而比前代 Qwen3.6-Plus 低了 1.1 分，说明纯代码能力并没有全面提升。另外，所有测试都是在特定框架和超参下跑的，换到你的实际业务里表现会打多少折，正文没给任何消融实验或误差分析。

现在最缺的信息是：这个模型跑一次手机操作任务要花多少钱、延迟多少秒，以及它能不能在本地部署。如果成本比拼接方案低很多，那才算是真正的卖点。
