# NVIDIA 在 CVPR 发了三篇物理 AI 论文：抓取、自动驾驶和游戏里练出来的智能体

> 原标题：NVIDIA Research Unlocks Advanced Grasping, Smarter Autonomous Driving and Agent Training at Scale

- 来源：NVIDIA 博客
- 发布时间：2026-06-03T15:00:57.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/33727
- 原文：https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/

## 摘要

这三篇论文都进了 CVPR。GraspGen-X 用 20 亿次模拟抓取训练，让机械手能处理没见过的物体，但正文没披露真实世界的抓取成功率。LCDrive 把自动驾驶的推理 token 砍了大约一半，靠的是让模型直接输出轨迹而不是先写文字再转成动作，延迟更低，不过没提极端场景下的安全性验证。NitroGen 在 1000 多个游戏里跑了 4 万小时的交...

## 推荐理由

NVIDIA 在 CVPR 放出的三篇论文，每篇都带着实打实的数字：GraspGen-X 用 20 亿次模拟抓取训练机械手，LCDrive 把自动驾驶模型的推理 token 砍掉一半，NitroGen 在 1000 多款游戏里攒了 4 万小时交互数据来训游戏 agent。我会先打个折——这是厂商研究打包发布，不是新模型或产品上线，所以重要性停在 78 分。但信息密度够高，对做机器人、自动驾驶和游戏 agent 的人有直接参考价值，尤其是用合成数据替代真实采集、降低推理延迟这两条思路，正文没披露具体硬件环境和延迟数字，这点先别太激动。

## 锐评

这三篇论文都进了 CVPR，方向选得挺准，但各自都有信息缺口。GraspGen-X 用 20 亿次模拟抓取训练，让机械手能处理没见过的物体，听起来规模很大，但正文没披露真实世界的抓取成功率，这点先别太激动——模拟里跑得再好，上了真机可能完全不是一回事。LCDrive 把自动驾驶的推理 token 砍了大约一半，靠的是让模型直接输出轨迹而不是先写文字再转成动作，延迟更低，不过没提极端场景下的安全性验证，比如突然闯入的行人或恶劣天气，缺了这部分很难判断它到底能不能上路。NitroGen 在 1000 多个游戏里跑了 4 万小时的交互数据来训练具身 agent，覆盖面广，但游戏环境和物理世界差距不小，迁移效果还得看后续验证。整体看，这三项工作更像是技术路线展示，离落地都还差关键验证环节。
