# 蚂蚁灵波开源 LingBot-Video：一个专为机器人设计的视频生成模型，用 MoE 架构把推理成本打下来

> 原标题：蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video

- 来源：AI HOT 精选
- 发布时间：2026-07-09T07:06:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43314
- 原文：https://www.ithome.com/0/974/517.htm

## 摘要

蚂蚁灵波发布了 LingBot-Video，一个专门给具身智能用的视频生成模型，代码已开源。它用 MoE 架构（混合专家）替代了传统的密集模型，总参数量 30B，但生成视频时只激活约 3B 参数，推理速度比同规模的密集模型快 3 倍左右。训练数据是 7 万小时的机器人相关视频，包括灵巧操作、导航和第一人称视角交互，不是网上随便扒的风景片。为了让生成的动...

## 推荐理由

蚂蚁灵波开源了 LingBot-Video，一个用 MoE 架构做的具身智能视频基模。我会先打个折：这是刚发布的新东西，还没有外部复现报告，效果别急着全信。但亮点挺实在——30B 参数只激活 3B，推理快 3 倍，意味着本地跑或上机器人端成本低不少。训练数据是 7 万小时机器人相关视频，不是网上扒的通用素材，这点比很多视频模型更对口。代码已开源，做这行的人可以直接拉下来试。

## 锐评

这个模型最大的卖点是务实：30B总参数，干活时只激活3B，推理速度比同体量密集模型快3倍。训练数据是7万小时机器人视角的视频，不是网上扒的风景片，这让它在RBench机器人操作视频基准上拿了0.620分，压过了Wan2.6和Seedance 1.5 Pro。内部测试里物理合理性和动作一致性也超过了NVIDIA Cosmos 3。

不过得分差距其实很小，0.620对0.607，领先幅度有限。文章没披露这3倍推理加速是在什么硬件上测的、batch size多少、显存占用如何，也没说7万小时数据里仿真数据和真实数据的比例。如果是真的省钱，对需要实时交互的机器人场景确实有用，但这点先别太激动，等第三方复现结果出来再说。
