# Gemini 现在能看视频学操作，然后自己上手点按、打字、滚动页面

> 原标题：Google DeepMind 为 Gemini 推出 agentic 视频理解功能

- 来源：AI HOT 精选
- 发布时间：2026-09-01T17:08:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54121
- 原文：https://deepmind.google/blog/introducing-agentic-video-in-gemini

## 摘要

Google DeepMind 给 Gemini 加了一个新能力：给它看一段操作界面的录屏，它就能看懂步骤，然后自己去完成同样的点击、输入和滚动。不是只描述画面，而是真的执行多步任务，比如填网页表单或在手机 App 里下单。这个功能已经在 Gemini 应用和 Google AI Studio 开放测试。不过正文没提延迟和成功率——UI 自动化智能体在...

## 推荐理由

Google DeepMind 给 Gemini 加了个挺直接的能力：给它看操作录屏，它就能学会步骤，自己去完成填表、下单这类多步 UI 任务。已经在 Gemini 应用和 AI Studio 开放测试，这点让实验门槛很低。但正文没提延迟和成功率——对 UI 自动化智能体来说，这两个数直接决定能不能用，我会先打个折，等实测数据出来再说。

## 锐评

Google DeepMind 给 Gemini 加了一个挺实用的能力：你给它一段操作界面的录屏，它不光能看懂步骤，还能自己上手去完成同样的点击、输入和滚动。这相当于让模型从“看图说话”进到了“看视频干活”，直接去填网页表单或在手机 App 里下单。功能已经在 Gemini 应用和 Google AI Studio 开放测试，门槛不高。

不过，这篇公告没提两个关键数字：完成一个任务要多久，以及成功率是多少。UI 自动化智能体在真实环境里很容易被弹窗、加载延迟或者界面微调卡住，没有这些数据，就没法判断它到底能不能用在生产流程里。另外，它目前是“看一段视频学一个任务”，能不能举一反三、处理没见过的界面，正文也没说。

我会先打个折：这更像一个方向性发布，告诉你 Gemini 开始能动手了，但离可靠的 UI 自动化助手还有距离。想试的话，建议先用简单、重复性高的任务跑跑看，别急着把它塞进关键业务链路。
