# Black Forest Labs 发布 FLUX 3：一个模型搞定图片、视频、音频和机器人动作预测

> 原标题：[AINews] Black Forest Labs FLUX 3 - Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model

- 来源：Latent Space
- 发布时间：2026-07-24T04:30:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46868
- 原文：https://www.latent.space/p/ainews-black-forest-labs-flux-3-multimodal

## 摘要

Black Forest Labs 推出了 FLUX 3，一个统一架构的多模态模型，能同时处理图片、视频、音频，甚至还能预测机器人的动作。官方博客说，在视频生成的偏好测试里，它赢了 Seedance 2.0、Gemini Omni 和 Grok Imagine，而且所有输出都自带原生音频。功能上，它支持文生视频、图生视频、视频生视频、关键帧过渡、多语言...

## 推荐理由

Black Forest Labs 发了 FLUX 3，一个统一架构的多模态模型，能出图、出视频、出音频，甚至还能预测机器人动作。官方博客说在视频生成的偏好测试里赢了 Seedance 2.0、Gemini Omni 和 Grok Imagine，所有输出自带原生音频。功能上支持文生视频、图生视频、视频生视频、关键帧过渡和多语言。我会先打个折：博客没给具体胜率、测试集规模和对比条件，也没公开模型权重或 demo，所以目前只能当一次技术宣告看。亮点在于用一套 flow 模型同时覆盖视觉、音频和动作预测，如果后续放出可复现结果，对多模态和机器人方向都有...

## 锐评

Black Forest Labs 这次发布的 FLUX 3 是个统一架构的多模态模型，能同时处理图片、视频、音频，甚至还能预测机器人的动作。官方博客说，在视频生成的偏好测试里，它赢了 Seedance 2.0、Gemini Omni 和 Grok Imagine，而且所有输出都自带原生音频，不用再单独配音。功能上支持文生视频、图生视频、关键帧过渡、多语言对话，还能把多个片段串成多镜头序列，听起来像是把几家前沿实验室的看家本领打包在了一起。

但我会先打个折。正文没披露参数量、训练数据规模，也没给具体的发布时间线，只提了一句会出一个开放权重的 Dev 版本。没有这些数字，很难判断它的实际成本和部署门槛。另外，机器人动作预测的部分是和 mimic 合作在真实工厂环境里做的，但具体任务、成功率、延迟这些关键指标都没展开。

还缺的东西挺多：技术报告或论文没看到，偏好测试的细节（比如样本量、评估标准）也没公开。如果后续能补上这些，才能判断它是不是真的在工程上做到了“一个模型干所有事”，还是只是演示效果好。
