想象一个场景你坐在一辆智能驾驶汽车的驾驶座上眼前是一块高清中控大屏上面实时渲染着车身周围的三维环境——行人、自行车、卡车、路沿所有东西都精准地浮在俯视图画面里。屏幕角落有一个小窗口在播放前视摄像头的原始画面你瞄一眼就能发现那个画面里的世界是扁平的一条条车道线向远方延伸、越来越窄直到消失。而屏幕中央的三维重建画面却告诉你前方二十米有一辆摩托车正在从右侧并线。这两个画面之间的gap就是这篇文章要聊的核心车是怎么把摄像头拍到的那些二维碎片拼成一张它能理解的空间地图的一、摄像头看到的和车需要的不是一回事人类驾驶员看世界没什么障碍。眼睛往前一望前方有没有车、有没有人这些信息几乎是本能地流入大脑。大脑在几毫秒内就完成了这是什么、离我多远、朝哪个方向走的判断。但摄像头不是这样工作的。一颗前视摄像头拍到的画面就是一张密密麻麻的像素网格。每个像素记录的是颜色和亮度它根本不知道这个东西是车还是这个东西是墙。要让车理解这张图里有什么传统方案靠的是2D目标检测把图片喂给CNN卷积神经网络CNN会在图上画出一堆矩形框告诉你这里有辆车这里有个人。这套方案在高速公路上挺管用——车少、车道线清晰、场景规范。但问题在于2D检测输出的结果是一个二维平面上的信息而车真正需要的是一个三维空间里的决策依据。你知道前方五十米有一辆车但它在哪个车道上相对你的速度是多少这些问题从一张二维图里很难准确回答。于是工程师们开始做一件事给2D检测结果加上深度估计。把我在图上看到了什么翻译成我在空间里处于什么位置。这个翻译流程有一个根本性的问题每一步都有误差误差会累积。检测框画歪了一点深度估计偏了一点坐标转换再偏一点最后输出的3D信息可能已经面目全非。而且每个步骤由不同的模型负责彼此之间的信息没有真正流通就像流水线上的工人各干各的交接的时候难免出错。这种分模块、层层翻译的架构学术界叫它Pipeline架构容易实现但天花板很明显——在繁忙的十字路口、鬼探头、逆光隧道出口它的脆弱性就暴露出来了。二、BEV把碎片视角拼成一张鸟瞰地图那么有没有一种方式让车直接从多路摄像头的原始数据出发一次性输出一个完整的三维理解有。这就是BEV鸟瞰图Bird’s Eye View。BEV的核心思想非常直观把车身周围所有摄像头画面统一投影到一个俯视角度的三维坐标系里。就像你站在正上方看一座城市所有的建筑、车辆、行人都在一张平面图上彼此之间的相对位置一目了然。你可以这样理解你面前有好几扇窗户每个窗户只能看到一小块区域角度还各不相同——前视窗看前方侧视窗看侧面倒车影像看后方。以前的做法是让司机分别从每扇窗户看出去靠人脑把信息拼起来。BEV相当于直接给你一张航拍图你往下一看全局尽收眼底不需要再做拼接这个动作了。但问题来了怎么把不同摄像头捕捉到的二维像素准确地贴到三维俯视图的正确位置上这里介绍BEV的第一代方案——IPM逆透视映射。原理不复杂利用相机内外参把二维图像上的每个像素通过几何变换投影到地平面上。简单说就是我知道每个摄像头在哪里、朝哪个方向看利用几何关系做一次倒推把图像还原成俯视视角。IPM在简单场景下效果不错但有一个致命假设地面是平的。一旦遇到坡道、颠簸、弯道这个假设就不成立了投影开始变形。而且IPM只利用了几何信息图像里丰富的语义信息完全没用上。所以IPM是起点不是终点。三、Transformer登场从看图到看懂关系真正让BEV方案发生质变的是Transformer架构的引入。在BEV视角下每个像素点需要被分配一个在三维空间中的位置。传统方法靠人工设计特征、用几何约束去猜。Transformer的思路完全不同——它让模型自己学习像素之间的关联从而推断空间关系。具体来说BEVFormer这个方案的做法很精妙。它引入了可学习的Query查询向量这个Query就像一群好奇的小探测器悬浮在BEV空间的每一个位置向多摄像头输入的图像特征发起提问这里有没有物体是什么离我多远这些Query利用了Deformable Attention可变形注意力机制——每个Query只去关注图像中跟它最相关的区域而不是把整张图的所有像素都扫一遍。就像在人群中找人你不会逐个扫描所有人的脸而是先看体型、看衣服颜色集中注意力看那些特征最匹配的人。可变形注意力做的就是这个筛选工作大幅降低了计算量同时让匹配更精准。Query和图像特征之间经过多轮交互后每个Query输出一个对应的BEV特征知道这个位置有什么物体、是什么类别、空间位置在哪里。多路Query汇总起来形成一张完整的BEV特征图。这张图妙在哪里它统一了时序和空间。当前的BEV特征不是凭空产生的而是基于当前帧和历史帧的Query交互结果叠加出来的。车在t时刻的BEV感知结果已经包含了t-1、t-2时刻的信息。所以它知道一辆车上一秒在左边两条车道下一秒可能正在并入你的车道——运动轨迹的预测是靠时序信息撑起来的。至此BEVTransformer真正实现了一件Pipeline架构做不到的事多摄像头信息在特征层面的深度融合。不是先检测再投影而是所有摄像头的原始特征在同一套Query机制下被统筹处理输出的BEV地图天然就是多摄像头协作的结果。四、Occupancy从识别物体到识别空间占用BEVTransformer已经很强大了但它仍然有一个软肋它只能识别训练时见过的物体类别。举个例子。你在高速上见过无数辆轿车、货车BEVTransformer的模型能准确检测出来。但有一天路上出现了一辆拉着超长钢筋的货车钢筋从车身侧面伸了出来角度刁钻只占了你车道宽度的一小块——这类东西在训练集里可能完全没有。传统目标检测这时候就傻眼了它不认识这个东西没有这个类别标签于是选择了漏检。漏检的结果就是那根钢管直接撞上了你的车。Occupancy Network占用网络就是为了解决这个问题而诞生的。Occupancy的核心思路非常优雅不再问这个像素是什么物体而是问这个格子空间有没有被占用。它的做法是把三维空间划分成一个个体素Voxel可以理解成三维的像素格子。每个体素格子有一个状态被占用或者空闲。模型输出的不再是一个个矩形框而是一整张空间占用图——世界不是由一辆车“一个人组成的而是由这里有东西”那里是空的组成的。你发现这个思路的妙处了吗它不需要知道这个东西是什么只要知道这里有东西就行了。一根异形的钢管、一个大石头、一只突然冲出来的动物——只要它们占用了空间系统就会标记这里非空障碍物规避立即触发不需要先去识别物体类别。Occupancy是感知层面的一次认知升级从识别已知物到理解自由空间。就像盲人走路不需要知道障碍物是什么材质用手杖感知到这里被挡住了就够了。五、传感器路线之争纯视觉还是加激光雷达说到这必须聊一个在自动驾驶圈争论了七八年都没停过的话题感知系统到底要不要用激光雷达马斯克的立场地球人都知道纯视觉。特斯拉的FSD一路从2D视觉走到Occupancy始终没有引入激光雷达。他的论点是人类开车只用眼睛摄像头加上好的算法理论上可以接近人类的感知能力。而且激光雷达贵、容易受恶劣天气影响。支持融合方案的工程师会反驳摄像头在黑夜、强光、暴雨、雾霾下的表现远不如人类激光雷达恰好能补上这些短板。直接输出精确距离信息在异形障碍物检测上天然就更鲁棒。这里面的技术路线之争本质上是安全冗余和成本之间的权衡。一个值得关注的趋势是随着BEVTransformerOccupancy这套方案越来越成熟纯视觉的上限正在被不断抬高。有没有激光雷达的差距在算法足够好的情况下正在慢慢缩小。但融合方案的上限同样在进步。这个争论短期内不会有结论。六、端到端的曙光感知和规划正在融为一体感知不是终点感知最终要服务于决策和规划。车看到前方有障碍物下一步是要绕过去还是停下来这属于规划模块的职责。传统架构里感知和规划是两个独立的模块它们之间通过精心设计的接口传递信息。感知输出前方有车规划接收前方有车然后决定减速。问题在于信息在传递过程中必然会有损耗。更深层的问题是规划真正需要知道的信息和感知天然输出的信息之间存在认知层面的gap。端到端方案End-to-End试图从根本上解决这个gap让模型直接从传感器原始数据出发端到端地输出驾驶决策。你不需要显式定义感知告诉规划什么模型自己学会了从像素到方向盘转角之间的映射。特斯拉宣称FSD已经实现了光子到扭矩的端到端链路。当然端到端也带来了新的挑战模型成了一个黑箱出了事故之后很难追溯到底是感知出了问题还是决策出了问题。安全验证和可解释性是这条路上最大的两座大山。七、范式收敛了但全国都能开还很远过去五年自动驾驶感知领域的范式经历了三次大的跃迁2020年之前是2D直视图CNN的天下2021到2023年是BEVTransformer全面接管2023年之后Occupancy开始普及端到端的探索也在加速。范式在收敛大方向越来越清晰。多摄像头统一到BEV空间、用Transformer处理跨摄像头关系、Occupancy补充语义感知、端到端打通感知和规划——这几条路线在头部玩家之间基本形成了共识。特斯拉、华为、小鹏、Waymo的技术栈在底层架构上的差异越来越小分歧主要在实现细节和工程优化上。但全国都能开仍然是句口号不是现实。原因不在感知算法本身而在于长尾问题。中国道路场景的复杂程度在地球上几乎无出其右——村道上的晾晒谷物、逆向行驶的电动车、横穿马路的行人、临时施工改道没有任何高精地图更新。这些场景的数据样本在训练集中极其稀少但恰恰是导致接管和事故的主要原因。感知模型的泛化能力再强也很难覆盖一个不断变化的世界中所有可能出现的异常。解决它们需要的不仅是更好的算法还需要在数据闭环、场景库建设、仿真验证、众包地图等多个维度协同推进。所以我的判断是感知范式的收敛是一个里程碑但它只是万里长征的一个节点。从在大部分路段表现良好到在全国所有场景都可以放心脱手这个差距需要用年来计算而不是用算法版本的迭代来衡量。不过好消息是整条技术栈的效率正在快速提升。曾经需要几十个工程师精心调配的Pipeline现在可以被一套统一的Transformer架构替代曾经需要专业标注员手动标注的3D框现在可以通过自监督和Occupancy自动生成训练信号。技术进步的速度从来都比悲观预测要快。你坐在车里看着屏幕上那个俯视视角的小车图标平稳地穿过一个繁忙的十字路口——那背后是一整套快速演进的感知系统在默默运转。而这个系统的下一版可能就会比今天再聪明一点点。一点点就够了。我们离终点还剩最后一段路。本文写于2026年8月。技术路线截至公开资料观点代表作者个人判断供讨论参考。