跳到正文
TechCrunch · AI

谷歌发布 Gemini Omni:用文字、图片和音频就能直接生成视频

Google’s Gemini Omni turns images, audio, and text into video — and that’s just the start

谷歌推出了新的多模态模型 Gemini Omni,能把文字、图片、音频和视频作为输入,通过对话直接生成或编辑视频。首发版本叫 Omni Flash,主打跨模态推理,也就是模型能同时理解不同格式的信息并据此产出视频。但文章没公布具体上线时间、价格、上下文长度限制、跑分成绩,也没说 API 什么时候开放。这点先别太激动,目前看更像是一个技术预告,实际能用起...

推荐理由:Google 把 Gemini 的多模态能力推到了视频生成这一步,Omni Flash 能通过聊天界面把文字、图片、音频甚至视频片段变成新视频,还能编辑。这个更新在 HKR 三个维度上都站得住:玩法直观有传播力,产品形态和输入模态是明确的新信息,而且正好卡在多模态视频生成这个竞争激烈的节点上。正文没公布定价和具体上线时间,所以我会先打个折,把它放在必写但不算顶格的区间。

读原文 ↗导出 Markdown