# NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型，能同时吃文字、图片、视频并生成视频、音频和动作指令

> 原标题：NVIDIA releases Cosmos 3 Omnimodal world modelson HF

- 来源：r/LocalLLaMA
- 发布时间：2026-06-02T05:26:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/32115
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tuhea4/nvidia_releases_cosmos_3_omnimodal_world_modelson/

## 摘要

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face，这次发了两个尺寸：Nano 版 160 亿参数，Super 版 640 亿参数。它是个全模态世界模型，输入可以混着来——文字、图片、视频甚至动作轨迹都行，输出也不止视频，还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了，实际跑起来的硬件门槛...

## 推荐理由

我会先打个折：正文没披露 benchmark 分数、许可证和训练细节，所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上，这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说，输入支持动作轨迹、输出能直接给动作指令，说明它不只是生成漂亮画面，而是想往物理交互方向靠。这点先别太激动，因为没看到在真实机器人任务上的验证，但方向对，且开源降低了试错成本。

## 锐评

NVIDIA 在 Hugging Face 上发了 Cosmos 3 系列，一个 Nano 版 160 亿参数，一个 Super 版 640 亿参数。这模型叫“全模态世界模型”，意思是输入不挑食——文字、图片、视频、动作轨迹都能喂，输出也不只吐视频，还能直接给图片、音频和下一步的动作指令。听起来像给机器人或自动驾驶做物理世界模拟用的，但 Reddit 原帖被网络策略挡了，正文没披露任何实测数据、硬件要求或具体任务表现。

160 亿参数的 Nano 版对本地玩家可能有点吸引力，但 640 亿参数的 Super 版大概率不是单张消费级显卡能跑的。目前能确认的只有模型上架这件事本身，至于生成质量、推理速度、跟上一代比进步多少，全得等第三方实测。这点先别太激动。
