# Gemini 3.5 Flash 现在能直接操作电脑界面了

> 原标题：Gemini 3.5 Flash 引入 computer use 功能

- 来源：AI HOT 精选
- 发布时间：2026-06-24T16:30:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40571
- 原文：https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash

## 摘要

Google 给 Gemini 3.5 Flash 加了一个内置的“操作电脑”工具，模型可以自己截图、点按钮、填表单，去操作网页和桌面软件界面。这跟 Anthropic 和 OpenAI 之前做的方向一样，都是把屏幕控制能力直接做进模型里。官方说在 WebVoyager 这个网页操作基准测试上，3.5 Flash 跑赢了 Claude Sonnet 4...

## 推荐理由

Google 给 Gemini 3.5 Flash 内置了电脑操作工具，模型能自己截图、点按钮、填表单，跟 Anthropic 和 OpenAI 的路线一致。官方在 WebVoyager 基准上跑赢了 Claude Sonnet 4，这点有数字撑腰。但我会先打个折：这是一篇博客公告，没给 API 定价，也没说实际延迟，所以现在只能当技术方向看，还不能直接算账。

## 锐评

Google 给 Gemini 3.5 Flash 加了个内置的“操作电脑”工具，模型可以自己截图、点按钮、填表单，去操作网页和桌面软件。这跟 Anthropic 和 OpenAI 之前做的方向一样，都是把屏幕控制能力直接做进模型里。官方说在 WebVoyager 这个网页操作基准测试上，3.5 Flash 跑赢了 Claude Sonnet 4 和 GPT-5，但没放出完整的评估细节和复现步骤，第三方验证还没跟上，这个跑分先打个折。

现在可以通过 Gemini API 和 AI Studio 用上这个功能，但正文没披露定价和调用频率限制。对想拿它做自动化流程的开发者来说，成本和稳定性是绕不开的问题，这两块信息缺口挺大。另外，模型直接操作屏幕的安全边界怎么划，文章也没展开，只提了有安全措施但没给具体方案。
