FLUX 3 开始控制机器人:一个模型同时生成视频和预测动作
Flux 3 X Mimic: The Next Generation of Video-Action Models
Black Forest Labs 把早期版 FLUX 3 装到了 mimic 的机器人上,已经在奥迪产线做过测试。FLUX 3 是一个模型同时生成图像、视频和音频,其中视频预测占了训练算力的 95% 以上。为了不出现画面穿帮,模型必须学会接触、运动和因果关系。把动作预测作为低维模态加进去时,视频质量一度掉了 10%,但训练 3500 步后就完全恢复。...
推荐理由:Black Forest Labs 把早期版 FLUX 3 装到 mimic 机器人上,在奥迪产线做了测试。一个模型同时出图像、视频和音频,其中视频预测占了训练算力的大头。为了画面不穿帮,模型得学会接触和因果,把动作预测当低维模态加进去时视频质量一度掉了 10%,但 3500 步就恢复。跨模态加物理部署加具体数字,三条都踩中了。没给更高分是因为正文没披露测试规模、成功率或产线具体任务细节,我会先打个折。