# CVPR 2026 上，小鹏给英伟达、特斯拉和 Waymo 讲了一遍自己的物理 AI 技术栈

> 原标题：CVPR 2026，英伟达特斯拉Waymo一块听中国公司讲物理AI

- 来源：量子位 · 公众号
- 发布时间：2026-06-04T08:26:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34417
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247895048&idx=1&sn=ec4a4ad3ed33dbb770e48ffd7b1c1a5c

## 摘要

小鹏在 CVPR 2026 上公开了他们的世界模型技术栈，包含 X-World、X-Foresight 和 X-Cache 三个部分。X-Cache 能砍掉约 70% 的重复计算，相当于让模型推理时少做无用功。第二代 VLA 模型用了超过 4 万亿个 token 训练，这个量级说明训练数据投入很大。车端推理延迟压到了 80 毫秒，对实时驾驶决策来说这个...

## 推荐理由

我会先打个折，这毕竟是小鹏在顶会上的技术展示，不是独立验证过的第三方评测，所以分数没给到 85 以上。但选题确实抓人：CVPR 舞台上让北美自动驾驶三巨头听一家中国公司讲物理 AI，本身就制造了对比。信息量也够，X-Cache 的七成重复计算缩减、4 万亿 token 的训练规模、80 毫秒的车端延迟，都是能直接拿来讨论的指标。正文没披露 X-Cache 具体在什么场景下测出这个节省比例，也没说 80 毫秒是平均还是 P99，这点先别太激动。整体看，对做自动驾驶和端侧模型的人有参考价值，也踩中了中美技术竞争的神经，所以放在 featured 位置。

## 锐评

这条消息最值得关注的是 X-Cache 那 70% 的重复计算削减，如果属实，意味着模型推理时不用每次都从头算一遍相似场景，对车端实时决策的功耗和延迟都有直接好处。80 毫秒的推理延迟也是个硬指标，低于人类反应时间，理论上够用。4 万亿 token 的训练量说明数据投入不小，但量级本身不说明模型质量，得看实际路测表现。

问题是这篇文章的正文被微信环境验证页完全挡住了，我只能看到摘要里的数字，看不到具体怎么实现的、在什么条件下测的、有没有第三方验证。X-Cache 砍掉的 70% 是在仿真环境还是实车场景？80 毫秒是平均还是 P99？这些都没法确认。

另外，英伟达、特斯拉、Waymo 同场听中国公司讲物理 AI 这个叙事本身有传播价值，但技术判断不能靠叙事撑。等有完整论文或技术博客出来再下结论比较稳。
