谷歌发了 Gemini Omni,一个能把图文视频混着输入、直接出视频的多模态模型
谷歌发布Gemini Omni多模态生成模型
谷歌在推上宣布了 Gemini Omni,说它能吃图像、视频和文本,吐出来的是基于 Gemini 现实世界知识生成的视频。目前只展示了视频生成这一个方向,正文没提模型大小、推理成本、能不能公开用、什么时候上线。我会先打个折:这更像一个预告,不是能立刻上手的东西。
推荐理由:谷歌扔了个 Gemini Omni,能拿图片、视频和文字一起喂进去,直接吐视频出来。我会先打个折:正文没披露模型多大、收不收费、什么时候能用,所以现在只能当个预告看。对跑视频管线的从业者来说,这个输入组合有点意思,但缺了价格和落地时间,暂时没法算账。