Gemini 现在能看视频学操作,然后自己上手点按、打字、滚动页面
Google DeepMind 为 Gemini 推出 agentic 视频理解功能
Google DeepMind 给 Gemini 加了一个新能力:给它看一段操作界面的录屏,它就能看懂步骤,然后自己去完成同样的点击、输入和滚动。不是只描述画面,而是真的执行多步任务,比如填网页表单或在手机 App 里下单。这个功能已经在 Gemini 应用和 Google AI Studio 开放测试。不过正文没提延迟和成功率——UI 自动化智能体在...
推荐理由:Google DeepMind 给 Gemini 加了个挺直接的能力:给它看操作录屏,它就能学会步骤,自己去完成填表、下单这类多步 UI 任务。已经在 Gemini 应用和 AI Studio 开放测试,这点让实验门槛很低。但正文没提延迟和成功率——对 UI 自动化智能体来说,这两个数直接决定能不能用,我会先打个折,等实测数据出来再说。