# FLUX 3 开始控制机器人：一个模型同时生成视频和预测动作

> 原标题：Flux 3 X Mimic: The Next Generation of Video-Action Models

- 来源：Hacker News 首页
- 发布时间：2026-07-24T09:31:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46336
- 原文：https://bfl.ai/blog/flux-3-mimic

## 摘要

Black Forest Labs 把早期版 FLUX 3 装到了 mimic 的机器人上，已经在奥迪产线做过测试。FLUX 3 是一个模型同时生成图像、视频和音频，其中视频预测占了训练算力的 95% 以上。为了不出现画面穿帮，模型必须学会接触、运动和因果关系。把动作预测作为低维模态加进去时，视频质量一度掉了 10%，但训练 3500 步后就完全恢复。...

## 推荐理由

Black Forest Labs 把早期版 FLUX 3 装到 mimic 机器人上，在奥迪产线做了测试。一个模型同时出图像、视频和音频，其中视频预测占了训练算力的大头。为了画面不穿帮，模型得学会接触和因果，把动作预测当低维模态加进去时视频质量一度掉了 10%，但 3500 步就恢复。跨模态加物理部署加具体数字，三条都踩中了。没给更高分是因为正文没披露测试规模、成功率或产线具体任务细节，我会先打个折。

## 锐评

Black Forest Labs 把还没正式发布的 FLUX 3 模型装到了 mimic 的机器人上，已经在奥迪产线做过测试。这件事的核心逻辑是：训练一个能生成逼真视频的模型，它就必须学会物理世界的接触、运动和因果关系，否则画面会穿帮。既然模型内部已经对物理世界有了理解，那让它顺便输出机器人的动作指令，理论上只是多开一个输出口，不需要另起炉灶。

他们给了一个关键数据：在训练中加入动作预测后，视频生成质量一度掉了 10%，但只跑了 3500 步就完全恢复。这说明模型只是花了一点时间把动作这个新模态和已有的世界理解对齐，并没有永久牺牲视频能力。训练算力上，视频预测占了 95% 以上，音频和动作都是低维度的“搭车”模态。

不过这篇博客更像一份架构声明，不是产品交付报告。正文没披露机器人在产线上的具体成功率、推理延迟、能处理的任务种类，也没说部署了多少台。所以“在奥迪测试过”这句话先打个折——可能是跑通了 demo，离真正替代产线工人还有距离。另外，动作解码器是轻量级的，但轻量级意味着什么程度的泛化能力，文章也没展开。如果后续能补上产线实测数据和失败案例分析，这个方向的说服力会强很多。
