尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

121、BEV感知:鸟瞰视角的视觉3D检测与占据预测

121、BEV感知:鸟瞰视角的视觉3D检测与占据预测 121、BEV感知:鸟瞰视角的视觉3D检测与占据预测从一次深夜debug说起上周三晚上十一点,实验室的机器人又撞上了走廊里的灭火器箱。导航模块明明给了个“可通过”的栅格,但底盘就是怼上去了。查了半天,问题出在感知链路——2D检测框投影到地面时,那个灭火器箱的高度信息被压扁成了零,代价地图直接把它当成了可压过的薄片。那一刻我意识到,纯前视摄像头的2D感知在机器人场景里就是耍流氓,我们需要的是鸟瞰视角下的3D结构化表达。这就是BEV感知存在的意义——把多目摄像头看到的透视图像,统一变换到车体/机器人本体坐标系下的俯视平面,在这个平面上做检测、分割、占据预测。对机器人来说,BEV空间天然和运动规划、代价地图对齐,省去了大量坐标变换的麻烦。透视到BEV:不是简单IPM很多初学者第一反应是搞个逆透视变换(IPM),把图像映射到地面平面。这思路在平坦路面、相机姿态固定的场景勉强能用,但机器人一颠簸、一爬坡,地面假设直接失效,映射出来的BEV图扭曲得妈都不认识。现代BEV感知的核心思路是让网络自己学出这个变换。LSS(Lift-Splat-Shoot)那套做法是经典中的经典——先对每个像素预测一个深度分布,把2D特征“抬升”到3D空间,再沿着高度维“拍扁”到BEV平面。但LSS有个硬伤:深度分布预测是离散的,分辨率有限,而且计算量感人。后来BEVFormer用可变形注意力直接在前视特征和BEV query之间建桥,绕开了显式深度估计。每个BEV格子作为一个query,通过可变形注意力去前
返回列表