# 谷歌发布 Gemini Omni：用文字、图片和音频就能直接生成视频

> 原标题：Google&#8217;s Gemini Omni turns images, audio, and text into video — and that&#8217;s just the start

- 来源：TechCrunch · AI
- 发布时间：2026-05-19T17:45:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23879
- 原文：https://techcrunch.com/2026/05/19/googles-gemini-omni-turns-images-audio-and-text-into-video-and-thats-just-the-start/

## 摘要

谷歌推出了新的多模态模型 Gemini Omni，能把文字、图片、音频和视频作为输入，通过对话直接生成或编辑视频。首发版本叫 Omni Flash，主打跨模态推理，也就是模型能同时理解不同格式的信息并据此产出视频。但文章没公布具体上线时间、价格、上下文长度限制、跑分成绩，也没说 API 什么时候开放。这点先别太激动，目前看更像是一个技术预告，实际能用起...

## 推荐理由

Google 把 Gemini 的多模态能力推到了视频生成这一步，Omni Flash 能通过聊天界面把文字、图片、音频甚至视频片段变成新视频，还能编辑。这个更新在 HKR 三个维度上都站得住：玩法直观有传播力，产品形态和输入模态是明确的新信息，而且正好卡在多模态视频生成这个竞争激烈的节点上。正文没公布定价和具体上线时间，所以我会先打个折，把它放在必写但不算顶格的区间。

## 锐评

谷歌这次发布的 Gemini Omni，简单说就是一个能通过对话直接生成或修改视频的多模态模型。你给它文字、图片、音频甚至一段视频，它都能理解，然后产出新的视频内容。首发版本叫 Omni Flash，主打跨模态推理，也就是模型能同时消化不同格式的信息再干活。

但文章里关键信息几乎全缺：没说什么时候能用、怎么收费、上下文窗口多大、也没给任何跑分对比。API 开放时间同样没提。所以这条新闻的价值在于知道谷歌把视频生成塞进了对话式模型里，方向是让创作门槛更低，但实际能不能打、成本多高，现在完全没法判断。

我会先打个折看待。视频生成本身就吃算力，加上多模态理解和对话交互，延迟和成本大概率不低。等谷歌放出实测样本、定价和第三方评测，再判断它是不是真能干活。
