# Qwen-RobotNav：一个模型搞定五种导航任务，还能让上层 AI 随时调整它的观察策略

> 原标题：Qwen-RobotNav：面向智能体导航系统的可扩展导航模型

- 来源：AI HOT 精选
- 发布时间：2026-06-16T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38603
- 原文：https://qwen.ai/blog?id=qwen-robotnav

## 摘要

Qwen 发布了一个叫 Qwen-RobotNav 的导航模型，基于 Qwen3-VL 训练，用 1560 万条样本学会了指令跟随、找东西、跟踪目标、自动驾驶和具身问答这五种活。它把视觉记忆的控制权开放了出来，像调节“看多少帧”、“更关注新画面还是旧画面”、“不同摄像头各占多少注意力”这些参数，都可以在运行时直接改，不用重新训练。在 EXPRESS-B...

## 推荐理由

Qwen 基于 Qwen3-VL 训了个机器人导航模型，1560万条样本学会五种活。亮点是把视觉记忆参数开放出来，运行时就能调，不用重新训练。这点先别太激动，因为正文没给真实机器人上的测试结果，目前还是仿真和数据集上的表现。

## 锐评

这条新闻最值得看的是他们把“怎么记住画面”这件事做成了可调节的接口。模型训练时用了 1560 万条样本，把视觉记忆的四个参数——总看多少帧、新旧画面各占多少注意力、不同摄像头权重、采样方式——全部随机化，所以推理时上层规划器可以直接调参，不用改模型结构。这相当于给导航模型装了个“记忆旋钮”，找东西时可以多看历史画面，跟踪目标时只看最近几帧，一套权重搞定五种任务。

数字上，他们在 VLN-CE RxR 上指令跟随成功率 76.5%，HM3Dv2 物体搜索只用 RGB 就达到 75.6%，超过了用深度信息的方法。EXPRESS-Bench 上比之前最好成绩高 15.4%，导航步数少 77%，说明规划效率确实有提升。但正文没披露这 1560 万条样本的具体构成和来源，也没说训练用了多少算力。实机验证只在一台 Unitree Go2 上做了零样本部署，用的是自带低分辨率单摄像头，场景覆盖有限。

还缺的是：这套参数化接口在不同机器人平台上的迁移成本、多摄像头配置下的上限表现，以及和现有导航栈的对比基准。如果后续能补上这些，对做机器人导航的人来说会更有参考价值。
