# Black Forest Labs 发布 FLUX 3，一个模型搞定图像、视频和音频，一次能生成 20 秒带声音的视频

> 原标题：Black Forest Labs 发布 FLUX 3 多模态模型，支持单次生成 20 秒视频与原生音频

- 来源：AI HOT 精选
- 发布时间：2026-07-24T06:48:04.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46322
- 原文：https://www.ithome.com/0/981/137.htm

## 摘要

FLUX 3 用统一架构把图像、视频和音频放在一起学，不再拆成几个模型拼凑。它一次能输出最长 20 秒的视频，并且自带原生音频，支持文生视频、图生视频、视频续写、关键帧转视频和多镜头串联。在带声音的 10 秒 720p 视频人工评测里，FLUX 3 赢 Grok Imagine Video 的概率是 69%，对比 Seedance 2.0 和 Gemi...

## 推荐理由

Black Forest Labs 发了 FLUX 3，一个统一的多模态模型，能直接出最长 20 秒带声音的视频，不是老路子的图像模型加个音频插件。69% 的胜率对比 Grok Imagine Video 给了它一点底气。没给 85 分是因为正文没提公开测试或第三方实测，实际效果还得等上手。

## 锐评

Black Forest Labs 这次发布的 FLUX 3，核心卖点是“统一架构”，不再像以前那样把画面和声音拆成几个模型拼起来干活。它用自监督流匹配的方法，让模型同时学图像、视频和音频，一次生成最长 20 秒、自带原生音频的视频。在 10 秒 720p 带声音视频的人工评测里，它比 Grok Imagine Video 强不少，胜率 69%，但跟 Seedance 2.0 和 Gemini Omni Flash 比只赢 52%，基本算打个平手，所以别把它当成碾压式的领先。

文章里没提参数量、推理延迟，也没说 Early Access 到底开放给多少人，这些信息缺口让实际可用性打了问号。另外，他们和 Mimic Robotics 合作把模型当机器人行为预测器用，这个方向挺有意思，但正文没披露任何具体效果数据，只能先当个概念验证看。

整体来说，FLUX 3 在技术路线上往前走了一步，把多模态生成揉进一个模型里，但现阶段公开的评测基准和落地细节太少，想判断它是不是真能省钱省事，还得等更多第三方实测和开放范围的信息。
