# ICML 2026：AutoMoT 用大小模型异步分工，在 Bench2Drive 和 nuScenes 上拿了双料第一

> 原标题：ICML2026 | AutoMoT : B2D &amp; nuScense双SOTA ，重新思考VLM和端到端驾驶的结合

- 来源：机器之心 · 公众号
- 发布时间：2026-05-28T04:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30054
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651035468&idx=3&sn=c2d8f60bfc41fea7fcdfcd7d25b83291

## 摘要

这篇文章本身被微信环境验证挡住了，正文内容没抓到，所以下面说的都基于标题和已知信息。AutoMoT 是南洋理工 AutoMan 实验室、哈佛和小米汽车一起搞的端到端驾驶模型，核心思路是把视觉语言模型和驾驶动作拆成两个专家：一个 4B 的 Qwen3-VL 负责看懂场景，一个 1.6B 的动作专家负责输出驾驶指令，而且两个模型是异步推理的，不用互相等。在...

## 推荐理由

我会先打个折：双 SOTA 听着唬人，但正文没披露 nuScenes 的具体指标，只能看到 Bench2Drive 的数据。亮点在于架构思路——把视觉语言模型和端到端驾驶拆成异步推理，大模型负责想、小模型负责开，不是硬塞进一个模型里。4B 的 Qwen3-VL UE 做决策，1.6B 的 AE 执行，这个组合在算力上挺省。不过论文没提实车验证，纯仿真成绩，这点先别太激动。整体看，对做自动驾驶算法的人有参考价值，但离出圈还差一口气，所以放在 featured 而不是更高一档。

## 锐评

AutoMoT 的思路是把 VLM 和端到端驾驶拆成两个专家，一个 4B 的 Qwen3-VL 负责看懂场景，一个 1.6B 的动作专家负责输出驾驶指令，而且两个模型异步推理，不用互相等。Bench2Drive 上驾驶得分 89.42，成功率 74.09%，nuScenes 也拿了 SOTA，说明这套“看懂的和开车的分开干”在仿真里跑得不错。

但这条消息有个硬伤：微信原文被验证墙挡住了，正文没抓到，所有信息都来自标题和摘要。模型怎么异步、训练用了什么偏好数据、实车验证有没有做，这些关键点全都没披露。4B 加 1.6B 两个模型跑在车上，延迟和算力成本是多少，正文也没说。

我会先打个折：Bench2Drive 是仿真基准，nuScenes 也是固定场景，离真实路况还有距离。两个专家异步推理听起来省时间，但万一理解专家慢了，动作专家拿到的还是旧场景，安全怎么保证，这点得等论文公开才能判断。
