谷歌发布 Gemini Omni 模型,任意输入都能生成任意输出,一句话就能改视频
谷歌 Gemini Omni 全能模型发布:可从任意输入生成任意输出,一句话让 AI 修改视频
谷歌在 I/O 2026 大会上推出了 Gemini Omni,这是 Gemini 家族目前能力最全的版本,能同时处理文字、图片、音频和视频,并直接生成这些格式的内容。现场演示了对话式视频编辑,用户说句话就能换掉视频里的角色或背景。先放出来的是速度更快的 Gemini Omni Flash,已经在 Gemini App、Google Flow 和 Yo...
推荐理由:谷歌在 I/O 上扔出 Gemini Omni 和 Omni Flash,主打全模态互转,一句话就能让 AI 改视频,听着挺猛。我会先打个折:API 什么时候开、怎么收费、跑分多少,正文全没提。Flash 已经进了自家三个产品,说明至少能跑起来,但外部开发者还得干等。这点先别太激动,等有定价和延迟数据再判断值不值得接。