# BFL 发布 FLUX 3：一个模型同时搞定视频、图片和音频

> 原标题：Flux 3

- 来源：Hacker News 首页
- 发布时间：2026-07-24T06:17:08.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46324
- 原文：https://bfl.ai/blog/flux-3

## 摘要

FLUX 3 是 BFL 的新多模态基础模型，把图片、视频和音频放在同一个架构里联合训练。它的思路是：单一模态信息不全，但把它们放在一起学，声音得匹配撞击、运动得服从质量，模型就能学到更底层的物理世界表征。视频生成已开放早期测试，支持文生视频、图生视频和视频转视频，最长 20 秒，自带原生音频。初步评测里，FLUX 3 在 69% 的对比中优于 Gro...

## 推荐理由

BFL 发了 FLUX 3，一个把图、视频、音频放在一起训练的多模态基础模型。视频生成已经开放早期测试，最长 20 秒，自带原生音频，初步对比赢了 69%。这是有具体数字的产品更新，多模态联合训练的路线也值得关注，所以给了 featured。

## 锐评

FLUX 3 的思路是把图片、视频和音频放在一起训练，让模型从不同信息源的互相约束里学物理规律，比如声音得对上撞击、运动得符合质量。这比单独训练一个模态更接近真实世界的表征。视频生成已经开放早期测试，最长能出 20 秒带原生音频的片段。初步评测里，它在 69% 的对比中赢了 Grok Imagine Video，77% 赢了 Runway Gen-4.5，93% 赢了 Luma Ray 3.2，但对上 Kling v3 Pro 只领先 60%，优势不算碾压。这些数字来自 BFL 自己的早期测试，样本量和评测标准正文没细说，所以先打个折看。另外，他们还跟 mimic robotics 合作，在奥迪产线上测试了微调版的动作预测能力，但具体效果和指标没给。整篇公告没提定价，也没说什么时候公开发布，想用的人还得等。
