# 英伟达放出 Nemotron-3-Ultra 超大 MoE 模型，550B 总参数但只激活 55B，最低要 8 张 H200 才能跑

> 原标题：nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-06-04T11:48:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34292
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1twla1k/nvidianvidianemotron3ultra550ba55bbf16_hugging/

## 摘要

英伟达在 Hugging Face 上发布了 Nemotron-3-Ultra-550B-A55B-BF16，一个混合专家（MoE）模型。总参数量 550B，但每次推理只激活其中 55B 参数，相当于用 55B 模型的算力去撬动大得多的知识容量。上下文窗口拉到 1M token，能一口气处理很长的文档。硬件门槛不低，官方列的最低配置是 8 张 H200...

## 推荐理由

这条消息干货集中在规模和硬件门槛上：550B 总参数、55B 激活、100 万 token 上下文，最低 8×H200 或 16×H100。我会先打个折——正文没给任何基准测试分数、许可证细节和具体开放时间，所以没法判断实际效果和可用性。亮点是硬件要求本身就是一个筛选器，能直接筛出一批会认真评估的人。缺点也明显：没有性能数据，光看参数和上下文长度，只能说明“理论上能处理很长的内容”，但不知道推理质量怎么样。这点先别太激动。整体属于有信息量但缺验证的发布，适合放进 featured 提醒大家关注后续评测。

## 锐评

英伟达放出了 Nemotron-3-Ultra，一个 550B 总参数的混合专家模型，每次推理只激活其中 55B 参数。这个设计的好处很直接：用 55B 模型的算力开销，换来接近大得多的模型的知识面。上下文窗口拉到 1M token，一口气能吞下整本长篇小说或大型代码库，做长文档摘要、代码审查这类任务会比较顺手。

硬件门槛是这条消息最需要打折的地方。官方列的最低配置是 8 张 H200，或者 16 张 H100，再或者 8 张 GB200/B200/GB300/B300。这个配置别说个人玩家，小团队都很难凑齐。所以虽然模型权重公开了，但“本地跑”对绝大多数人来说暂时不现实。

正文没披露具体的评测基准分数和推理延迟数据，也没说在 agent 工作流或外挂资料库场景下的实测表现。这些信息缺口让“强不强”暂时只能靠架构参数去猜。建议等第三方跑出实际任务成绩和量化版本后再做判断。
