# 视频智能体是下一个方向：Ethan He 谈 xAI Grok Imagine 的三个月从零到一

> 原标题：Why Video Agent models are next — Ethan He, xAI Grok Imagine

- 来源：Latent Space
- 发布时间：2026-06-01T15:41:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35523
- 原文：https://www.latent.space/p/video-agents

## 摘要

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI，带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点：视频模型现在的智能主要来自语言模型，不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型，而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

## 推荐理由

我会先打个折：这篇是访谈级别的信号，不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实，也点出了视频 Agent、音视频对齐和推理加速这几个方向，但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告，能帮你判断他们在往哪使劲，但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼，别当结论用。

## 锐评

这期播客最有价值的点，是 Ethan He 把视频模型这行的底裤掀了：智能主要靠语言模型迁移，不是靠烧钱堆视频数据。他带一个小团队三个月就做出 Grok Imagine，说明迭代速度比堆资源重要得多，很多大提升来自修数据管线里的小 bug。这个判断如果成立，意味着视频生成的下一个分水岭不是更好的画质，而是让模型能像程序员一样规划、生成、自己改稿——也就是视频智能体。

播客里还聊了几个硬成本：训练视频模型的存储、出口流量和 GPU 小时数高得吓人，但通过步数蒸馏和一致性模型，推理速度能快几个数量级。音频和视频的对齐比文字难做，这点正文没展开具体技术方案。另外，Ethan 提到 Flipbook 这种即时生成 UI 可能取代传统前端，但现阶段还只是个 demo，离产品化有多远没说。

信息缺口很明显：Grok Imagine 的实际效果、成本、规模都没给具体数字，xAI 的研究沟通被他自己评价为“低估了模型”。他离开 xAI 转向语言模型的原因也只提了一句，没展开。这些关键信息缺失，让他的判断听起来有道理，但暂时只能当方向参考，不能直接当结论用。
