Black Forest Labs 发布 FLUX 3,一个模型搞定图像、视频和音频,一次能生成 20 秒带声音的视频
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频
FLUX 3 用统一架构把图像、视频和音频放在一起学,不再拆成几个模型拼凑。它一次能输出最长 20 秒的视频,并且自带原生音频,支持文生视频、图生视频、视频续写、关键帧转视频和多镜头串联。在带声音的 10 秒 720p 视频人工评测里,FLUX 3 赢 Grok Imagine Video 的概率是 69%,对比 Seedance 2.0 和 Gemi...
推荐理由:Black Forest Labs 发了 FLUX 3,一个统一的多模态模型,能直接出最长 20 秒带声音的视频,不是老路子的图像模型加个音频插件。69% 的胜率对比 Grok Imagine Video 给了它一点底气。没给 85 分是因为正文没提公开测试或第三方实测,实际效果还得等上手。