尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Qwen-RobotNav:15.6M样本训练,可重配置的导航模型

Qwen-RobotNav:15.6M样本训练,可重配置的导航模型 Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System作者Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Haoyang Li, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen核心发表机构论文源码未明确标注或暂未可靠识别论文链接arXiv:2606.18112v3发布于arXiv 预印本cs.RO|—|—|—|—|—|—|—|—|—|| 全景 | Qwen-RobotNav-4B | 3.80 | 77.2 | 69.5 | 63.6 | 3.80 | 71.9 | 75.2 | 65.0 || 全景 | Qwen-RobotNav-8B |3.53|78.5|72.1|66.6|3.58|72.5|76.5|65.7|| 单目 | Qwen-RobotNav-4B | 4.22 |73.6|66.9|60.5| 4.15 | 68.6 | 71.3 | 61.5 || 单目 | Qwen-RobotNav-8B | 4.36 | 72.7 | 65.7 | 59.6 | 4.16 | 69.9 |73.4|63.5|4.2.2 VLNVerse 与 VLN-PEVLNVerse 细粒度设置下Qwen-RobotNav-8B 取得 SR 63.75%、SPL 57.93%超过 NavFoM 的 SR 12.2%、SPL 25.5%超过 Uni-NaVid 的 SR 18.0%、SPL 31.0%粗粒度设置下取得 SR 46.59%、SPL 41.54%超过 NavFoM 的 SR 8.6%、SPL 18.4%。SPL 增益显著大于 SR 增益说明模型不仅更常到达目标路径效率也明显更高。4B 变体同样超过所有基线说明优势不单纯来自模型规模。VLN-PE 使用 flash controller 解耦规划与控制。Qwen-RobotNav-8B 取得 SR 65.50%、SPL 61.19%最低导航误差 3.73 m最高 oracle success 72.99%超过 InternVLA-N1 的 SR 5.1%、SPL 6.3%。4B 变体 SR 60.28%接近 InternVLA-N1 的 60.36%但 oracle success 更高72.70% vs 67.63%表明更小的模型在靠近目标处的规划能力也更强。该基准的完整对比表格因源码片段截断未能完整呈现以上数据来自论文正文的描述性结果。4.2.3 ObjectNavMP3D/HM3D 与 HM3D-OVON在 MP3D ObjectNav 上Qwen-RobotNav-4B 仅使用 RGB 即取得 SR 52.2%超过所有使用深度或里程计的基线包括 CogNav46.6%与 WMNav45.4%8B 取得最高 SPL 17.7%。在 HM3D ObjectNav 上Qwen-RobotNav-4B 在难度更高的 HM3D v2Semantics v0.2216 场景上取得 SR 75.6%、距离目标 1.72 m超过 Uni-NaVid 在 HM3D v1120 场景上报告的 73.7%8B 的 HM3D SR 71.2%、SPL 33.0%。需要注意的是HM3D v2 与 v1 在语义标注与场景池规模上存在差异因此与部分基线不是严格同设置比较但 Qwen-RobotNav 在更难版本上仍取得了更优结果。方法MP3D SR↑MP3D SPL↑HM3D SR↑HM3D SPL↑WMNav† ‡ ^{\dagger\ddagger}†‡45.417.258.131.2CogNav† ‡ ^{\dagger\ddagger}†‡46.616.172.526.2Uni-NaVid‡ ^\ddagger‡––73.737.1Qwen-RobotNav-4B52.216.075.630.6Qwen-RobotNav-8B48.817.771.233.0自开放词汇目标导航 HM3D-OVON 上Qwen-RobotNav-4B 在 Seen 和 Synonyms 的 SR 上取得最高57.7% / 60.1%Unseen 的 SR 53.1% 略低于 ABot-N0 的 54.0%。需要强调的是Qwen-RobotNav 使用单前向相机而 ABot-N0 使用全景多视图360°场景覆盖大幅减少主动探索需求。Qwen-RobotNav 仍在 Seen / Synonyms 上超过 ABot-N0 的 SR 2.4% / 4.7%。8B 变体在这两个 split 上也超过 ABot-N0且 SPL 更高28.5% / 28.8%。但整体上 Qwen-RobotNav 的 SPL 低于 NavFoM 与 ABot-N0论文解释为reach-first 探索行为基于骨架的训练轨迹鼓励逐房间彻底搜索提高了目标发现率但以更长路径为代价。方法Seen SR↑Seen SPL↑Syn SR↑Syn SPL↑Unseen SR↑Unseen SPL↑NavFoM40.127.145.432.645.231.9ABot-N055.332.155.433.254.030.5Qwen-RobotNav-4B57.724.460.125.153.120.9Qwen-RobotNav-8B56.128.557.828.851.224.04.2.4 主动视觉跟踪EVT-Bench在 EVT-Bench 单目标跟踪划分上Qwen-RobotNav-4B 取得最高跟踪率 TR 90.0%8B 为 89.7%超过 ABot-N087.6%2.4%、NavFoM80.5%9.5% 以及专用跟踪器 TrackVLA81.0%9.0%。8B 在通用模型中有最低碰撞率 CR 5.70%明显低于 ABot-N0 的 8.54%。但成功率SR方面 Qwen-RobotNav 4B/8B 仅为 77.4% / 78.6%低于 ABot-N0 的 86.9% 与 TrackVLA 的 86.0%。论文假设是更广泛的多任务训练引入权衡——模型能保持更紧密的跟随行为TR 更高但对声明剧集成功更保守。这是一个值得注意的通用基础模型与任务专用模型之间的能力权衡。方法TR↑CR↓SR↑TrackVLA78.61.6585.1TrackVLA81.02.1086.0ABot-N087.68.5486.9Qwen-RobotNav-4B90.06.4077.4Qwen-RobotNav-8B89.75.7078.64.2.5 具身问答EQA论文将 Qwen-RobotNav-SB 与上层规划器 Qwen3.5-Plus / Qwen3.6-Plus 组合评估长时程具身问答。最佳变体 Qwen3.6-Plus Qwen-RobotNav-8B 在 HM-EQA 上取得 Acc 76.7%、Steps 0.15在 MT-HM3D 上取得 Acc 54.4%、Steps 0.19在 EXPRESS-Bench 上取得 LLM Score 79.27、E path E_{\text{path}}Epath​33.96。相比此前最佳方法 FAST-EQAHM-EQA 提升 7.5 个百分点MT-HM3D 提升 3.9 个百分点EXPRESS-Bench LLM Score 提升 10.57同时大幅减少导航步数HM-EQA Steps 从 0.65 降至 0.15表明学习到的执行器支持更有针对性的物理探索导航效率提升使系统可以用更少的等价步到达目标位置。方法HM-EQA Acc↑HM-EQA Steps↓MT-HM3D Acc↑MT-HM3D Steps↓EXPRESS LLM Score↑EXPRESSE path E_{\text{path}}Epath​↑FAST-EQA69.20.6550.50.5268.729.25Qwen3.5-Plus Qwen-RobotNav-8B74.10.1752.10.2277.6631.73Qwen3.6-Plus Qwen-RobotNav-8B76.70.1554.40.1979.2733.964.2.6 自动驾驶NAVSIM 与 AlpaSim在 NAVSIM 闭环规划中评估时在 prompt 中提供前三帧真值轨迹作为历史先验。Qwen-RobotNav-4B 取得 PDMS 91.4、NC 99.8、TTC 98.5超过 NavFoM 7.1、AutoVLA 2.3、ReCogDrive 0.6、ReflectDrive 0.38B 的 PDMS 为 90.9。与无历史 ego-status prior 的变体相比两个模型的 PDMS 增益均超过 11 点从 79.5 提升至 91.4说明短期轨迹历史是闭环驾驶预测的关键条件。图 [Qualitative closed-loop planning visualization on NAVSIM.] 展示了 NAVSIM 上的闭环规划可视化在左转场景中模型利用多视角观测、ego-state 与历史轨迹预测平滑转向轨迹预测路径贴合环岛曲率从进入转向过渡到对齐驶出车道。方法NC↑DAC↑TTC↑Comf.↑EP↑PDMS↑Qwen-RobotNav-4B‡ ^\ddag‡无历史先验96.490.989.099.975.279.5Qwen-RobotNav-8B‡ ^\ddag‡无历史先验95.991.388.410075.579.5Qwen-RobotNav-4B99.897.598.599.984.491.4Qwen-RobotNav-8B99.896.998.299.984.290.9AlpaSim 是一个零样本闭环驾驶基准使用 PhysicalAI-AV NuRec 920 个场景报告 at-fault 指标。Qwen-RobotNav 直接在模拟器中 rollout没有 AlpaSim 特定训练或闭环适应因此衡量的是通用视觉-语言导航模型在长时程自动驾驶仿真中的域外迁移能力。Qwen-RobotNav 明显落后于为该评估专门设计的 Alpamayo-R1 模型8B 的 AlpaSim Score 0.17 vs Alpamayo-R1-10B 的 0.72但实现了非平凡的零样本闭环性能。从 4B 到 8BOff-Road Rate 从 34.0% 降至 27.0%AlpaSim Score 从 0.15 提升至 0.17说明更大骨干提供更好的闭环稳定性与场景级泛化。图 [Qualitative zero-shot closed-loop simulation visualization on AlpaSim.] 展示了 AlpaSim 上的零样本可视化右转场景中自车接近路口减速直行、执行右转并避开道路边界直行场景中绿灯亮起后自车从停止状态启动安全通过复杂多智能体路口。方法CER↓ (%)ORR↓ (%)AlpaSim Score↑Alpamayo-R1-0.5B9.019.00.35Alpamayo-R1-10B4.016.00.72Qwen-RobotNav-4B22.034.00.15Qwen-RobotNav-8B22.027.00.174.2.7 部署延迟论文同时探索了云端推理与端侧推理两种部署方式。云端部署中机器人上传压缩观测和文本指令到远程服务器接收规划动作支持更大模型与更快服务器侧推理但引入通信开销并依赖网络稳定性。端侧部署直接在机器人NVIDIA Jetson Thor上运行使用 FP8 量化与 TensorRT 加速消除传输延迟并提高鲁棒性但受限于板载算力。在 Unitree Go2 上对 Qwen-RobotNav-4B 的延迟评测显示远程服务器平均端到端延迟 196 ms5.1 Hz端侧平均 204 ms4.9 Hz。远程平均略快但延迟方差更大、存在尖峰端侧更稳定对延迟敏感任务如目标跟踪更可靠。图 [Deployment architecture and latency comparison of -4B on Unitree Go2. Left: remote-server and edge deployment pipelines, where edge inference runs on Jetson Thor with FP8 quantization and TensorRT acceleration. Right: latency evaluation, including (a) per-frame latency fluctuations and (b) average latency breakdown for both deployments.] 展示了部署架构与延迟对比。4.3 消融实验 / Ablation Study4.3.1 数据规模论文将导航训练数据从 12.5% 逐步增加到 100%观察各基准性能变化。结果显示大多数任务随数据量增加有明确增益长时程任务如 VLN-CE RxR 提升尤为显著说明更广的轨迹覆盖改善语言指令与扩展视觉历史之间的 grounding短时程任务如目标跟踪EVT-Bench用中等数据量即可快速提升随后饱和并出现轻微非单调波动说明一旦学到基本跟踪行为对额外数据不敏感。完整数据模型在保持长时程与跨具身任务增益的同时仍具竞争力。图 [Data scaling behavior of .] 展示了数据规模对多个基准性能的影响。4.3.2 Token 预算与时间衰减论文在 Qwen-RobotNav-4B 上使用 500 个 VLN-CE R2R Val-Unseen episodes固定一个参数扫描另一个。Token 预算扫描固定γ 2.0 \gamma2.0γ2.0B BB从 2048 到 4608显示SR 从 70.8%B 2048 B2048B2048提升到 74.6%B 4608 B4608B4608OSR 从 78.9% 上升并在B 3584 B3584B3584时达到峰值 82.7%之后略降。更多视觉 token 通常提供更丰富空间上下文、提升目标到达能力但过大或分配不当的视觉上下文会导致收益递减。时间衰减扫描固定B 3072 B3072B3072γ \gammaγ从 0.5 到 3.5显示OSR 从 78.8%γ 0.5 \gamma0.5γ0.5提升到 82.6%γ 3.5 \gamma3.5γ3.5SR 在γ 3.0 \gamma3.0γ3.0时达到峰值 72.5% 后略降。更大的γ \gammaγ将更多 token 集中到近期帧增强对当前场景的解析能力但牺牲早期历史上下文对 VLN-CE 这类需要即时反应又需参考早期地标的任务近因偏差总体有益但存在 trade-offoracle success 在高γ \gammaγ下继续改善而严格 success 与路径质量指标饱和或轻微波动。图 [Ablation on token budgetB BBand temporal decay $$.] 直观展示了这一消融结果。)4.3.3 历史先验、模型规模与多任务效应NAVSIM 中的对照实验表明去掉历史 ego-status prior 后 PDMS 从 91.4 降至 79.5说明 ego 动力学信息对驾驶规划质量贡献显著。模型规模方面4B 变体在许多基准上已超过全部基线8B 进一步在 VLN-CE、VLNVerse、VLN-PE、MP3D SPL、OVON SPL 等指标上提升说明规模扩展有利但 VLN-CE R2R 单目下 8B 略低于 4B说明存在规模非单调现象具体原因论文未进一步展开。多任务联合训练则形成可跨任务族迁移的共享空间规划基底例如在主动视觉跟踪中Qwen-RobotNav 的 TR 更高但 SR 低于专用模型在 OVON 中 SPL 较低reach-first这些都体现了多任务训练带来的行为权衡而非单一能力的简单叠加。视觉-语言联合训练的必要性也在论文中被反复强调纯轨迹训练会导致模型坍缩为反应式动作序列映射器联合训练才能维持感知基座与开放世界理解能力。4.4 真实世界部署论文在多个真实世界场景中验证了 Qwen-RobotNav 的 zero-shot 泛化能力。未见展览厅 VLN 部署在之前未见过的展览厅中包含客厅、医疗室、开放走廊等多种场景与物体高度 out-of-distribution四足机器人仅凭纯语言指令从 living room 区域导航到 21.78 米外的 medical room。模型利用沿途视觉地标家具、门道、标识将语言指令 grounding 到空间决策成功穿越多个视觉不同区域。收到反向指令后机器人还能切换运动模式精确倒退沿原路返回至与起始位姿接近的位置。这展示了三个关键能力仅凭自然语言忠实解释并执行多样运动原语包括倒退这种非标准行为利用前向导航中遇到的视觉地标维持返回路径的空间意识在杂乱且未见环境中被指示到之前访问过的位置时精确返回到准确位置。图 [Real-world VLN deployment in an unseen exhibition hall.] 展示了这一部署过程。公寓室内逐步语言指令导航在包含卧室、客厅、浴室的公寓环境中模型行为可通过自然语言命令精确控制。例如指令“停在床左侧的床头柜”使机器人进入卧室并停在指定侧“在出门进入客厅之前转身”使机器人完成绕行而非直接路径。四个代表性示例均能一致地将细粒度语言指令转化为准确导航行为表明 Qwen-RobotNav 在复杂室内环境中提供可靠、精确的语言控制。图 [Indoor deployment with verbal commands.] 展示了室内部署场景。Agentic 真实世界长时程导航论文还展示了一个完整 agentic 任务。用户开放指令为“检查 Cotti Coffee 是否遗留了一把绿色雨伞并报告沿途显著观察”。上层 agent 解析用户请求并观察初始场景更新记忆并识别有用地标沿走廊走向可能的店铺区域导航中记录中间线索如 Alibaba logo并用于细化定位到达店铺区域后检查场景观察到绿色雨伞生成最终答复“伞似乎还在那里”。整个过程中上层 agent 将开放请求分解为连续子目标并维护跨轮“证据笔记本”Qwen-RobotNav 执行 grounded 导航片段并返回轨迹证据供后续规划。图 [Real-world long-horizon navigation with agentic .] 展示了这一 agentic 长时程任务的选帧流程。五、相关工作 / Related WorkQwen-RobotNav 与现有工作的区别可以从以下几个维度理解。导航基础模型与固定观测策略。NavFoM 对所有帧做均匀子采样ABot-N0 只保留滑窗二者都在部署时固化了单一上下文假设。Qwen-RobotNav 通过参数化接口支持推理时动态调整 token budget、时间衰减、相机权重与帧采样模式使同一个模型能够在“全局历史模式”探索与“近期聚焦模式”精确局部机动之间无缝切换。这不仅是性能上的提升更是能力范式的变化将观测上下文作为“第一类、外部可控自由度”。多任务导航模型与专用模型。与 DualVLN、Uni-NaVid、InternVLA-N1 等专用导航模型相比Qwen-RobotNav 是多任务联合训练的产物。单目 VLN-CE 中 Qwen-RobotNav 在 R2R 上小幅领先 DualVLN在 RxR 长指令上大幅领先VLNVerse 上相对于 Uni-NaVid 的 SR/SPL 增益显著。与 TrackVLA 等专用跟踪器相比Qwen-RobotNav 的 TR 更高但成功率和低碰撞率存在权衡。与 Alpamayo-R1 等专用驾驶模型相比Qwen-RobotNav 在 AlpaSim 零样本闭环中仍有明显差距这说明专用模型在目标任务上仍保有优势通用模型的价值在于跨任务迁移与可组合性。视觉-语言动作模型VLA与轨迹预测模型。许多 VLA 模型直接将观测映射为低级动作或在训练中固化了动作空间。Qwen-RobotNav 将导航统一为航点轨迹预测并通过视觉-语言联合训练避免退化为反应式动作序列映射器。论文明确指出仅用轨迹数据训练会导致模型坍缩丧失开放世界感知能力与视觉-语言数据联合训练是维持感知基座与空间推理能力的关键。这一发现与 VLM-to-VLA 迁移的研究方向一致语言中介的推理一旦被内化即可作为跨任务可迁移的脚手架。Agentic 导航系统。在 EQA 等长时程场景中许多方法依赖显式的 reasoning、exploration、memory 模块作为模型本体。Qwen-RobotNav 采用不同的分工上层规划器Qwen3.6-Plus负责高层目标分解、记忆维护与动态配置Qwen-RobotNav 作为反应式执行器高频预测航点。两层之间仅用自然语言通信通过轻量级工具接口完成任务模式与观测配置的动态切换。这种设计使复杂行为从对同一模型的重复调用中涌现而不是训练一个端到端的长时程策略。六、局限性与展望 / Limitations Future Work尽管 Qwen-RobotNav 在多个基准上取得了显著进展论文自身的实验结果也揭示了若干明确的局限性。域外自动驾驶闭环性能仍然薄弱。在 AlpaSim 零样本闭环仿真中Qwen-RobotNav 的 AlpaSim Score 仅为 0.15–0.17远低于为该评估设计的 Alpamayo-R10.35–0.72。虽然 CER 和 ORR 随模型规模增大有所改善但通用导航模型在长时程自动驾驶闭环仿真中仍弱于专用模型。这提示跨具身迁移存在上限尤其是在动态多智能体交互密集的驾驶场景中。开放词汇目标导航的路径效率。Qwen-RobotNav 在 HM3D-OVON 的 Seen/Synonyms SR 上领先但 SPL 明显低于 ABot-N0 与 NavFoM如 Unseen SPL 20.9/24.0 vs 31.9/30.5。论文将其归因于基于骨架训练轨迹导致的 reach-first 探索行为逐房间彻底搜索提高了目标发现率却以更长路径为代价。如何在学习到彻底搜索的同时保持路径效率是一个待解决的问题。主动视觉跟踪中的碰撞与成功率权衡。Qwen-RobotNav 的 TR 最高90.0% / 89.7%但 SR 低于专用跟踪器77.4% / 78.6% vs 85–86.9%CR 也高于 TrackVLA 系列。这意味着模型在持续跟随目标上表现优异但在“最终成功到达”或“安全避碰”方面尚未达到最佳平衡。多任务训练带来的行为权衡在跟踪任务中体现得尤为明显。NAVSIM 对 ego-status prior 的强依赖。去掉历史 ego-status prior 后Qwen-RobotNav 的 PDMS 从 91.4 降至 79.5。这说明驾驶任务中 ego 动力学信息对规划质量贡献显著模型对短期轨迹历史的依赖既是优势能有效利用也是局限缺少时性能大幅下降。此外DAC 与 EP 仍分别低于 ReflectDrive 与 ReCogDrive。VLN-CE 单目下的规模非单调性。R2R 单目设置下 8B 的 SR65.7%低于 4B66.9%NE 也略差。这说明模型规模增大并不在所有配置与任务上自动带来提升。论文没有进一步分析这一非单调现象的具体原因也未提供 2B 变体的系统结果从摘要可知 2B 到 8B 整体呈有利 scaling但中间存在局部波动。评测公平性问题。HM3D ObjectNav 的评估中Qwen-RobotNav 在更难的 v2 上评估而许多 prior 方法报告的是 v1 结果OVON 中 Qwen-RobotNav 使用单前向相机ABot-N0 使用全景多视图。这些设置差异要求读者在比较具体数值时保持谨慎。虽然论文在这些条件下仍取得了优势但严格的公平比较尚需更多工作。Token 分配算法的经验性。作者自评其约束化 token 分配是一种经验性启发式用于暴露统一接口控制模型 token 上下文。当前时间衰减γ \gammaγ的指数形式、相机权重的固定默认值以及迭代分配的收敛规则均未经过理论最优性论证。论文指出未来可以由更 principled 的 token allocation 算法如可学习的分配策略或基于信息密度的动态分配替代以进一步提升上下文利用率。数据层面局限。目标跟踪数据仅来自 EVT-Bench 单一模拟环境T2V 生成数据规模仅 40K虽然提供了高视觉多样性但物理精确性受单目深度估计与姿态估计质量限制。自动驾驶数据中 nuScenes 仅 78K 原始轨迹其余主要依赖 OpenScene。这些数据构造策略在规模与多样性上的权衡论文未做详细消融。未来方向可以归纳为将 token 分配从启发式升级为可学习或可微模块在保持通用性的同时缩小与专用模型在跟踪成功率、驾驶闭环安全等指标上的差距扩展 2B/4B/8B 之外的模型规模与数据规模的联合 scaling 研究以及在更多真实世界平台无人机、轮式机器人、四足机器人和更长时程任务中验证 agentic 接口的价值。七、总结 / ConclusionQwen-RobotNav 提出了一种以“可重配置观测上下文”为核心的导航基础模型设计范式。它将多任务导航的挑战从架构创新重新定义为上下文建模问题通过参数化接口将任务模式与观测参数外部化使同一个 Qwen3-VL 骨干能够在推理时被上层智能体动态配置支持从全局历史探索到近期聚焦跟踪的多种上下文策略切换。训练时对所有观测参数随机化配合 15.6M 样本的导航轨迹与视觉-语言联合训练模型对任意推理时配置鲁棒避免了纯轨迹训练导致的反应式动作序列映射器坍缩并发展出跨任务族共享的空间规划基底。实验表明Qwen-RobotNav 在 VLN-CE、VLNVerse、VLN-PE、ObjectNav、OVON、EVT-Bench、NAVSIM 与 EQA 等广泛基准上取得新 SOTA在 2B 到 8B 规模上呈现有利 scaling并在真实世界未见环境中展示了纯语言导航、细粒度指令控制与 agentic 长时程任务部署的能力。与此同时论文在 AlpaSim 域外驾驶、OVON 路径效率、跟踪成功率与碰撞率、规模非单调性以及 token 分配的经验性等方面暴露了明确的局限。将观测上下文作为“第一类、外部可控自由度”这一设计哲学为构建面向 agentic system 的可扩展导航基础模型提供了一个有前途的方向。原文摘要:Agentic navigation systems require a base navigation model whose observation strategy can be externally reconfigured at inference time, because instruction following, object search, target tracking, and autonomous driving share the same perception-planning backbone yet demand fundamentally different strategies for consuming the visual stream. We present Qwen-RobotNav, a scalable navigation model built on Qwen-RobotNav that addresses it through a parameterised interface with two complementary dimensions: multiple task modes that select the navigation behaviour, and controllable observation parameters (e.g., token budget, per-camera weights) that govern how visual history is encoded. With training-time randomization over all parameters, Qwen-RobotNav is robust to any inference-time configuration requiring zero architectural modification to the Qwen-RobotNav backbone. We train Qwen-RobotNav on 15.6M samples; co-training with vision-language data prevents the collapse into reactive action-sequence mappers observed in trajectory-only training. The parameterised interface also makes Qwen-RobotNav a natural building block for agentic systems: for long-horizon scenarios, an upper-level planner decomposes goals into sub-tasks and dynamically switches Qwen-RobotNav’s task mode and context strategy mid-episode, composing complex behaviours from repeated calls to the same model. Extensive experiments show that Qwen-RobotNav sets new state-of-the-art results across major navigation benchmarks. The model exhibits favourable scaling from 2B to 8B parameters, with joint multi-task training developing a shared spatial-planning substrate that transfers across task families, and demonstrates strong zero-shot generalisation to real-world robots across diverse environments.PDF链接:https://arxiv.org/pdf/2606.18112v3部分平台可能图片显示异常请以我的博客内容为准
返回列表