# NVIDIA 说 Vera Rubin NVL72 跑 AI 智能体每瓦能干 H100 30 倍的活

> 原标题：NVIDIA Vera Rubin NVL72 树立 AI 智能体效率新标准：每瓦特工作量提升至 30 倍

- 来源：AI HOT 精选
- 发布时间：2026-08-24T15:00:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52528
- 原文：https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents

## 摘要

NVIDIA 官方博客放出一组内部测试数据：用 Llama 3.3 70B 模型跑智能体工作流（让模型进业务流程干活），Vera Rubin NVL72 整机柜系统每瓦完成的工作量是 H100 的 30 倍。这个 30 倍是峰值数字，正文没披露延迟数据和完整的测试配置，所以实际部署时我会先打个折。新系统定在 2026 年下半年上市，主打推理和智能体场景。

## 推荐理由

NVIDIA 的 30 倍能效提升有具体模型和场景撑着，不是空喊口号。但正文没披露延迟和完整测试配置，实际跑起来肯定要缩水。对搞基础设施的人有用，对更广泛的 AI 从业者来说，时间还早，先观望。

## 锐评

NVIDIA 官方博客放了一组内部测试数据，用 Llama 3.3 70B 模型跑智能体工作流（让模型进业务流程干活），Vera Rubin NVL72 整机柜系统每瓦完成的工作量是 H100 的 30 倍。这个 30 倍是峰值数字，正文没披露延迟数据和完整的测试配置，所以实际部署时我会先打个折。新系统定在 2026 年下半年上市，主打推理和智能体场景。

值得留意的是，这篇博客只给了“每瓦工作量”这一个维度，没提单次推理的绝对延迟、并发上限，也没说测试用了什么具体的智能体任务。如果只看能效比，30 倍确实夸张，但不知道这是不是牺牲了响应速度换来的。另外，对比基准是 H100，不是 H200 或 B200，这个参照系选得有点取巧。

还缺什么：完整的测试配置、延迟数据、不同 batch size 下的表现，以及第三方复现结果。如果这些数字后续能补上，才能判断这 30 倍在真实业务里能兑现多少。
