# 英伟达发布 Nemotron 3 Nano Omni：一个模型同时看懂图文、听懂语音，做 AI 代理时吞吐量号称是同类 9 倍

> 原标题：NVIDIA Launches Nemotron 3 Nano Omni Model, Unifying Vision, Audio and Language for up to 9x More Efficient AI Agents

- 来源：NVIDIA 博客
- 发布时间：2026-04-28T16:00:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11366
- 原文：https://blogs.nvidia.com/blog/nemotron-3-nano-omni-multimodal-ai-agents/

## 摘要

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni，一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构（MoE），实际激活的参数量是 3B，配合 Conv3D 和 EVS 技术来处理音视频，上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下，跑 A...

## 推荐理由

NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里，还开放了权重和训练技术。我会先打个折：9 倍效率提升是跟谁比、测什么任务，正文没细说，这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置，加上直接上 Hugging Face 和 OpenRouter，对想用开源方案搭多模态 agent 的团队确实省事。单信源，信息够用但不算独家，所以放在 featured 里。

## 锐评

NVIDIA 这次放出的 Nemotron 3 Nano Omni，核心卖点是“什么都能看”和“跑得快”。它用了混合专家架构（MoE），总参数 30B，但每次推理只激活 3B，这意味着在消费级显卡上也能跑，官方说同等交互延迟下吞吐量能到之前的 9 倍。输入模态覆盖了文字、图片、音频、视频、文档、图表甚至屏幕界面，上下文窗口拉到 256K，明显是冲着让模型直接操作软件、看懂长视频这类 agent 场景去的。

不过，这篇博客没给出具体的基准测试分数，只说“保持交互延迟不变”，没讲跟谁比、在什么硬件上测的。9 倍这个数字先打个折看，实际跑起来的效果还得等社区在 Hugging Face 上实测。另外，模型权重、数据集和训练方法都开源了，这点对想微调的人来说是好事，但数据集的合规性和偏见程度正文没提，落地前得自己排查。
