
116、导航数据集与评测:从Habitat到真实场景的导航基准昨晚调了一宿的导航模型,最后发现不是模型的问题,是评测指标算错了。这事搁谁身上都得摔键盘。导航这个方向,数据集的坑比模型结构深多了,今天把这两年踩过的雷都倒出来。先说说为什么导航评测这么难搞做VLA的兄弟都知道,操作任务你给个成功率就完事了,顶多加个平均步数。但导航不一样,一个agent在环境里走半天,你说它到底走得好不好?走到目标点算成功,但绕了十圈才到,和直线走过去,能一样吗?更别提那些压根没到目标但路径规划得很漂亮的case。Habitat这个平台出来的时候,大家觉得终于有标准答案了。SPL、Success Rate这些指标看着挺科学,真用起来全是坑。我记得第一次跑Habitat的PointNav任务,模型在迷宫里转悠了500步终于找到目标,SPL算出来0.02,我当时还觉得模型废物,后来发现是评测脚本里有个坐标系的bug,目标点坐标转换错了,模型压根就是在找一个不存在的位置。Habitat的评测体系到底在测什么Habitat 2.0的导航任务分几个层级,PointNav是找点,ObjectNav是找物体,RoomNav是找房间。每个任务都有对应的数据集,MP3D、Gibson这些场景库都是激光扫描的真实建筑重建的,不是那种程序化生成的假场景。这里有个关键点,很多人没意识到:Habitat的评测是"模拟器内评测",你的agent在仿真环境里感知、决策、行动,每一步都是确定性的物理模拟。这跟真实世界最大的区别在于——仿真环境里没有传感器噪声,没