inclusionAI 开源 VISTA-4B,一个能看懂屏幕截图、帮你点按钮的视觉模型
inclusionAI 发布 VISTA-4B GUI 定位视觉语言模型
inclusionAI 在 Hugging Face 上放出了 VISTA-4B,一个基于 Qwen3.5 的 40 亿参数视觉语言模型。它的核心能力是 GUI 元素定位:你给它一张屏幕截图和一句指令,它就能指出目标按钮或区域在哪。模型标签里带了 gui-grounding 和 reinforcement-learning,说明团队用了强化学习来提升定...
推荐理由:4B 的 GUI 定位模型方向实用,用强化学习训练也是个技术信号,但模型卡实在太干净了——零基准、零数据说明、零横向对比。我会先打个折,等他们补上评测再认真看。