# 谷歌发布 Gemini Omni 模型，任意输入都能生成任意输出，一句话就能改视频

> 原标题：谷歌 Gemini Omni 全能模型发布：可从任意输入生成任意输出，一句话让 AI 修改视频

- 来源：AI HOT 精选
- 发布时间：2026-05-19T17:26:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23746
- 原文：https://www.ithome.com/0/952/519.htm

## 摘要

谷歌在 I/O 2026 大会上推出了 Gemini Omni，这是 Gemini 家族目前能力最全的版本，能同时处理文字、图片、音频和视频，并直接生成这些格式的内容。现场演示了对话式视频编辑，用户说句话就能换掉视频里的角色或背景。先放出来的是速度更快的 Gemini Omni Flash，已经在 Gemini App、Google Flow 和 Yo...

## 推荐理由

谷歌在 I/O 上扔出 Gemini Omni 和 Omni Flash，主打全模态互转，一句话就能让 AI 改视频，听着挺猛。我会先打个折：API 什么时候开、怎么收费、跑分多少，正文全没提。Flash 已经进了自家三个产品，说明至少能跑起来，但外部开发者还得干等。这点先别太激动，等有定价和延迟数据再判断值不值得接。

## 锐评

谷歌在 I/O 大会上把 Gemini Omni 定位成“全能模型”，核心卖点是任意模态输入、任意模态输出，现场演示的对话式视频编辑确实降低了视频修改的门槛。但文章只说了“即日起可用”的是速度更快的 Omni Flash 版本，而且只限 Gemini App、Google Flow 和 YouTube Shorts 这几个自家产品，API 什么时候开放、收费多少、完整版 Omni 什么时候来，正文全都没提。

对开发者来说，现在能判断的东西很少。没有推理成本、延迟、生成质量对比，也没说视频编辑的时长上限或分辨率限制。如果只是把多模态生成能力打包进一个模型，那和现有方案的区别有多大，还得等实际跑起来再看。

另外，文章引用的演示视频来自微博，不是官方技术博客或论文，信息量有限。建议等 API 上线后看定价和实际效果，再判断它是不是真的“全能”。
