跳到正文
Hacker News 首页

BFL 发布 FLUX 3:一个模型同时搞定视频、图片和音频

Flux 3

FLUX 3 是 BFL 的新多模态基础模型,把图片、视频和音频放在同一个架构里联合训练。它的思路是:单一模态信息不全,但把它们放在一起学,声音得匹配撞击、运动得服从质量,模型就能学到更底层的物理世界表征。视频生成已开放早期测试,支持文生视频、图生视频和视频转视频,最长 20 秒,自带原生音频。初步评测里,FLUX 3 在 69% 的对比中优于 Gro...

推荐理由:BFL 发了 FLUX 3,一个把图、视频、音频放在一起训练的多模态基础模型。视频生成已经开放早期测试,最长 20 秒,自带原生音频,初步对比赢了 69%。这是有具体数字的产品更新,多模态联合训练的路线也值得关注,所以给了 featured。

读原文 ↗导出 Markdown