# inclusionAI 开源 VISTA-4B，一个能看懂屏幕截图、帮你点按钮的视觉模型

> 原标题：inclusionAI 发布 VISTA-4B GUI 定位视觉语言模型

- 来源：AI HOT 精选
- 发布时间：2026-06-12T08:59:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38026
- 原文：https://huggingface.co/inclusionAI/VISTA-4B

## 摘要

inclusionAI 在 Hugging Face 上放出了 VISTA-4B，一个基于 Qwen3.5 的 40 亿参数视觉语言模型。它的核心能力是 GUI 元素定位：你给它一张屏幕截图和一句指令，它就能指出目标按钮或区域在哪。模型标签里带了 gui-grounding 和 reinforcement-learning，说明团队用了强化学习来提升定...

## 推荐理由

4B 的 GUI 定位模型方向实用，用强化学习训练也是个技术信号，但模型卡实在太干净了——零基准、零数据说明、零横向对比。我会先打个折，等他们补上评测再认真看。

## 锐评

inclusionAI 在 Hugging Face 上开源了 VISTA-4B，一个基于 Qwen3.5 的 40 亿参数视觉语言模型。它的核心本事是 GUI 元素定位：你给它一张屏幕截图和一句指令，它就能指出目标按钮或区域在哪。模型标签里带了 gui-grounding 和 reinforcement-learning，说明团队用了强化学习来提升定位准确度，这点挺务实，因为光靠传统训练，模型在复杂界面上很容易点歪。

代码示例覆盖了 Transformers、vLLM 和 SGLang，用 Apache 2.0 协议，部署门槛不高。但正文没披露任何基准测试分数、训练数据规模或推理延迟。40 亿参数在视觉语言模型里算轻量，如果定位准确度能打，在手机或电脑上做自动化操作会很省钱；如果准确度不行，那这个参数量就只是省了个寂寞。

现在缺的是实打实的评测——比如在 ScreenSpot 这类 GUI 定位基准上的准确率，以及在不同分辨率截图下的响应速度。这些数字出来之前，我只能把它当成一个有潜力的开源轮子，离能干活还有距离。
