# 谷歌发了 Gemini Omni，一个能把图文视频混着输入、直接出视频的多模态模型

> 原标题：谷歌发布Gemini Omni多模态生成模型

- 来源：AI HOT 精选
- 发布时间：2026-05-19T19:07:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23760
- 原文：https://x.com/GeminiApp/status/2056814052039356806

## 摘要

谷歌在推上宣布了 Gemini Omni，说它能吃图像、视频和文本，吐出来的是基于 Gemini 现实世界知识生成的视频。目前只展示了视频生成这一个方向，正文没提模型大小、推理成本、能不能公开用、什么时候上线。我会先打个折：这更像一个预告，不是能立刻上手的东西。

## 推荐理由

谷歌扔了个 Gemini Omni，能拿图片、视频和文字一起喂进去，直接吐视频出来。我会先打个折：正文没披露模型多大、收不收费、什么时候能用，所以现在只能当个预告看。对跑视频管线的从业者来说，这个输入组合有点意思，但缺了价格和落地时间，暂时没法算账。

## 锐评

谷歌在推上扔了个 Gemini Omni 的预告，说它能吃图像、视频和文本，吐出来的是基于 Gemini 现实世界知识生成的视频。目前只展示了视频生成这一个方向，正文没提模型大小、推理成本、能不能公开用、什么时候上线。我会先打个折：这更像一个概念预告，不是能立刻上手的东西。

从信息量看，这条推文只给了输入输出模态的组合方式，没给任何技术细节。视频生成本身不新鲜，但把图像、视频、文本三种输入揉在一起，再结合模型自己的知识库去生成视频，这个管线如果真跑通了，对视频创作工具的冲击会很大。不过现在连一个 demo 视频链接都没有，只能靠脑补。

还缺的东西很多：模型是端到端还是多个模块拼的？生成一段视频要多久、花多少钱？对输入素材有什么限制？这些全没披露。建议等 IO 大会后续放出论文或试用入口再认真看，现在激动太早。
