跳到正文
Latent Space

视频智能体是下一个方向:Ethan He 谈 xAI Grok Imagine 的三个月从零到一

Why Video Agent models are next — Ethan He, xAI Grok Imagine

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI,带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点:视频模型现在的智能主要来自语言模型,不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型,而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

推荐理由:我会先打个折:这篇是访谈级别的信号,不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实,也点出了视频 Agent、音视频对齐和推理加速这几个方向,但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告,能帮你判断他们在往哪使劲,但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼,别当结论用。

读原文 ↗导出 Markdown