具身智能之VLN-R1:怎样用强化微调训练视觉语言导航智能体
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读Vision-Language NavigationVLN要求智能体听懂“穿过厨房左转在卧室门口停下”这类指令并在环境中走到目标位置。早期导航方法大多在预先构建的拓扑图上选择下一个节点即便采用大语言模型也经常先把视觉观察转成文本或把可行动作限制在离散路点之间。这样的系统便于规划却难以对应真实机器人持续移动、转向和纠错的过程。VLN-R1 选择了一条更端到端的路线把第一人称视频流、历史观测和语言指令交给 Qwen2-VL直接输出FORWARD / TURN-LEFT / TURN-RIGHT / STOP四类原子动作训练先用专家轨迹做监督微调SFT再借鉴 DeepSeek-R1 的 Group Relative Policy OptimizationGRPO进行强化微调RFT。它为导航序列设计了 Time-Decayed RewardTDR越靠近当前时刻的正确动作奖励权重越高。论文的论证顺序是Introduction 和 Related Work 先说明离散图与模块化视觉处理的局限Methodology 依次介绍 GRPO、VLN-Ego 数据引擎、SFT 与 RFTExperiments 检验连续导航、跨域迁移和关键设计的消融最后明确模拟环境与离散动作空间仍是主要边界。图 1VLN-R1 将导航输入改为第一人称视频并把 LVLM 的输出改成连续环境中的原子动作序列训练分为文本监督的 SFT 与奖励驱动的 RFT。来源论文 Figure 1。猫先生认为VLN-R1 的核心不只是“把 RL 用到导航上”。它把视觉语言模型的文本续写能力改造成可验证的多步动作预测再让奖励函数明确区分“眼前一步走对”和“遥远未来猜对”。论文标题VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning论文地址https://arxiv.org/abs/2506.17221项目主页https://vlnr1.github.io/论文源码https://arxiv.org/e-print/2506.17221原文脉络原文 Section 1 将问题从离散 VLN 推向连续 VLN-CESection 2 回顾连续导航、LLM/LVLM 导航与强化后训练三条研究线。Section 3 是核心3.1 给出 RLVR/GRPO 预备知识3.2 构建 VLN-Ego3.3 用 Long-Short Memory Sampling 做 SFT3.4 以 TDR 做 RFT。Section 4 依次报告实现细节、主结果和消融Section 5 总结并讨论限制。1–2. Introduction 与 Related Work连续导航不能只是在图上换一个规划器离散 VLN 中环境通常被编码成可跳转的节点图智能体在节点之间移动。图结构提供了干净的候选集合但也把“往前走一点、转 30 度、发现走错后修正”压缩成对既定连边的选择。连续 VLN-CE 虽允许低层控制却常依赖深度图、导航图、CLIP 等额外模块系统的视觉理解、路径规划和动作执行仍然分离。LLM 进入 VLN 后常扮演语言规划器图像先被外部视觉模型描述成文本再由语言模型选择路线。VLN-R1 认为这种串联会积累视觉描述误差并且难以充分利用 LVLM 的原始视觉表征。它保留四个离散原子动作却让这些动作在 Habitat 的连续物理环境中执行“连续”指的是移动与观测过程不再依赖预给路点而不是让网络直接回归任意线速度和角速度。强化微调是另一条关键背景。数学、代码任务中GRPO 可以凭可验证答案给模型相对优势信号导航没有一段天然唯一的推理文本却有专家未来动作序列。论文的转化是将每一步动作是否正确变成软的时序奖励而非把整段输出只判为对或错。3. Methodology从视频记忆到时间敏感的动作奖励3.1 Preliminary为什么选择 GRPO而不是只做动作文本监督VLN-R1 使用 RL with Verifiable Rewards 的思路。对同一输入策略采样一组动作序列按回报在组内归一化得到相对优势GRPO 不需要额外训练 critic 或奖励模型同时用 KL 项约束新策略不要偏离 SFT 参考策略。直观地说模型不是只记住某条专家答案而是在同一段视频和指令下比较多种候选动作序列强化相对更接近目标轨迹的那一组。这一选择适合导航的前提是奖励可以验证。论文并未从真实环境成功率直接回传稀疏奖励而是使用未来动作标注构造密集信号。因此它更接近“带序列结构的专家动作后训练”优势是训练稳定、样本效率高局限是奖励仍受演示轨迹定义约束。3.2 Dataset EngineVLN-Ego 将连续轨迹改写为可训练的视觉语言样本VLN-Ego 由 Habitat 仿真器生成底层使用 Matterport3D 的 90 个场景61 个训练场景、11 个 val-seen、18 个 val-unseen。数据沿用 R2R 的 7,189 条轨迹和英语 RxR 的 42,023 条轨迹最终得到约 63 万条 R2R 训练样本和 120 万条 RxR 训练样本。每个样本由三部分拼成语言指令、视觉部分、动作部分。视觉部分同时保留历史帧和当前第一人称观察动作部分给出四个选项并将未来 6 步专家动作写成文本。这个格式很重要LVLM 学的不是抽象的“向目标靠近”而是带有候选符号与动作描述的连续未来序列。图 2VLN-Ego 从 Habitat 连续轨迹中收集动作级标注并将输入拆为 Instruction、Vision、Action 三部分。来源论文 Figure 2。3.3 Supervised Fine-TuningLong-Short Memory Sampling 保留“刚看见的”和“很早看见的”均匀采样会把近期转弯线索与很久以前的画面同等对待单纯指数衰减又容易忘记长路径中早先经过的房间。Long-Short Memory Sampling 将历史分成两段近端时间窗密集采样较远历史按更大间隔稀疏采样。它希望同时回答两个导航问题眼前该不该转弯以及此前是否已经经过某个地标。SFT 阶段模型在指令、历史帧和当前帧条件下自回归生成未来 6 步动作文本以交叉熵对齐专家序列。动作文本同时含选项标识与自然语言动作描述例如“向左转 30 度”。这比单一类别标签多了一层语言约束但本质仍是专家行为克隆只要整段文本的 token 被平均对齐模型就很难感知第 1 步错误与第 6 步错误在控制后果上的差别。3.4 Reinforcement Fine-TuningTDR 将多步预测变成位置敏感的优化目标RFT 沿用同样的输入输出格式但只从生成文本中抽取动作序列。对第t tt个未来动作若预测a ^ t \hat a_ta^t与专家a t a_tat一致就得到 1否则为 0再以指数衰减为更近动作分配更高权重r T D R ∑ t 1 T γ t − 1 I [ a ^ t a t ] , 0 γ 1 r_{\mathrm{TDR}}\sum_{t1}^{T}\gamma^{t-1}\,\mathbb{I}[\hat a_ta_t],\qquad 0\gamma1rTDRt1∑Tγt−1I[a^tat],0γ1第一个动作最能改变接下来看到的画面也最值得被严格优化较远动作仍被计入回报但不会与近期动作等权。随后 GRPO 在一组采样结果内根据相对回报更新策略。图 3两阶段训练共享第一人称视频与语言输入区别在于 SFT 对齐输出文本RFT 对动作序列施加 TDR。来源论文 Figure 3。猫先生认为TDR 的合理性来自闭环控制而不只是“指数衰减很常见”。预测错了第一步智能体的后续观测就会改变原本正确的第 6 步也失去原语境因此让近期动作获得更高信用分配确实比整段 token 等权更贴合导航。4. ExperimentsRFT 是否让更小的 LVLM 学会连续导航4.1 Implementation Details只用 RGB 第一人称视频的设定作者在 VLN-Ego 上训练 Qwen2-VL-2B 和 Qwen2-VL-7B。SFT 使用 R2R 与 RxR 合计 180 万样本RFT 从两者各随机取 1 万条共 2 万样本。评测采用 18 个未见过的 val-unseen 场景并使用 VLN-CE 的 SR成功率、OSOracle Success、SPL按路径长度加权的成功率、NE导航误差和 TL轨迹长度。这是一项只输入自我视角 RGB 视频的比较不使用深度、里程计或全局地图。4.2 Main ResultsRFT 在 R2R 与 RxR 上都带来明显提升R2R val-unseen 上2B 的 SFT 模型 SR/SPL 为 21.2/15.9经过 RFT 后升至 25.6/20.57B 则从 24.9/17.5 升至 30.2/21.8。论文特别强调RFT 后的 2B 在若干指标上接近甚至超过 SFT 的 7B说明后训练信号可以部分替代单纯扩大模型规模。跨域情形更能说明 RFT 的数据效率仅在 R2R 做 SFT、再用 1 万条 RxR 样本进行 RFT 时2B 和 7B 在 RxR 的 SR 分别达到 20.7 与 22.7高于对应 SFT 的 14.1 与 14.9。这个结论应读成“少量目标域专家动作对齐可显著改善迁移”而不是 RFT 已经摆脱对目标域轨迹的依赖。同时SR、OS 与 SPL 需要一起看。SR 只问最终是否到达OS 允许沿途曾接近目标SPL 还会惩罚绕远路因此 7B RFT 在 R2R 上达到 30.2 SR、41.2 OS、21.8 SPL说明它既更常抵达目标也仍保留了一定路径效率。相比之下RFT 2B 的导航误差并未在所有设置中同步下降提示后训练提升并不等价于每一种轨迹质量指标都单调变好。这也是后续应报告失败轨迹的原因。4.3 Ablation Study动作长度、记忆采样与奖励形状都在起作用消融使用 Qwen2-VL-7B 与 R2R。SFT 阶段预测未来 6 步动作的 SR 为 24.9高于单步15.1、4 步21.4和 8 步22.7Long-Short Memory Sampling 的 SR 也是 24.9高于平均采样与指数衰减。RFT 中组采样数从 2 提高到 8 时 SR/OS 达到 30.2/41.2奖励函数方面指数时间衰减同样取得 30.2/41.2优于硬奖励23.8/32.3、全动作等权25.0/33.0和线性加权28.3/33.6。图 4定性轨迹展示了 VLN-R1 的闭环执行过程它说明模型能随视角变化持续产生动作但不能替代大规模真实环境鲁棒性评测。来源论文 Figure 4。5. Conclusion and Limitation一条面向连续 VLN 的后训练路线而非真实机器人导航终点VLN-R1 将 LVLM 的第一人称视频理解、六步动作预测和 GRPO 后训练放进同一条连续 VLN 链路。VLN-Ego 提供了可验证的动作级监督Long-Short Memory Sampling 解决视频历史的取舍TDR 则把序列错误的时间位置写进奖励。实验支持这套组合在 VLN-CE 及小样本跨域迁移中有效。论文自己也给出两项关键限制评测只在室内仿真环境进行真实世界中的视觉噪声、动力学与安全约束尚未验证动作空间仍是四个离散原子动作不能覆盖精细的连续速度控制。再进一步说TDR 依赖专家未来动作作为奖励参照面对多条同样可行的路径或在线探索时还需要更接近任务成功与安全约束的奖励设计。猫先生认为这篇工作最值得带走的是一个可迁移的后训练范式先将具身任务改写为可验证的多步输出再让奖励尊重控制中的时间因果。它是否能走向真机取决于下一步能否用不依赖专家未来序列的信号处理连续控制和开放环境中的多解路径。参考资料Qi et al., 论文 PDFVLN-R1 团队项目主页Qi et al., arXiv 源码包推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列