Black Forest Labs 发布 FLUX 3:一个模型搞定图片、视频、音频和机器人动作预测
[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model
Black Forest Labs 推出了 FLUX 3,一个统一架构的多模态模型,能同时处理图片、视频、音频,甚至还能预测机器人的动作。官方博客说,在视频生成的偏好测试里,它赢了 Seedance 2.0、Gemini Omni 和 Grok Imagine,而且所有输出都自带原生音频。功能上,它支持文生视频、图生视频、视频生视频、关键帧过渡、多语言...
推荐理由:Black Forest Labs 发了 FLUX 3,一个统一架构的多模态模型,能出图、出视频、出音频,甚至还能预测机器人动作。官方博客说在视频生成的偏好测试里赢了 Seedance 2.0、Gemini Omni 和 Grok Imagine,所有输出自带原生音频。功能上支持文生视频、图生视频、视频生视频、关键帧过渡和多语言。我会先打个折:博客没给具体胜率、测试集规模和对比条件,也没公开模型权重或 demo,所以目前只能当一次技术宣告看。亮点在于用一套 flow 模型同时覆盖视觉、音频和动作预测,如果后续放出可复现结果,对多模态和机器人方向都有...