尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

一个神经网络开全程?端到端自动驾驶到底是不是噱头

一个神经网络开全程?端到端自动驾驶到底是不是噱头 前阵子某车企在发布会上抛出一句话震得圈内人直摇头——他们的车用一个神经网络就能从摄像头直接输出方向盘角度不需要任何人工写的规则。听起来像科幻片对吧更像是营销团队喝高了写的PPT。但这句话背后确实藏着一场真正的技术路线之争端到端自动驾驶到底是革命性的范式转移还是又一个被资本催熟的噱头先别急着站队。这件事的本质远比用一个神经网络开车这句话复杂得多。模块化流水线传统派的流水车间要理解端到端在争论什么得先看它要颠覆的是什么。传统自动驾驶系统的架构基本可以理解为一个高度分工的流水车间。感知模块负责看——把摄像头、激光雷达的原始数据翻译成车道线、障碍物、红绿灯这类结构化信息预测模块负责猜——前面的车会不会变道那个行人是要过马路还是在路边等公交规划模块负责想——我要走哪条轨迹什么时候变道控制模块负责动——方向盘打多少度油门踩多深每个模块各司其职模块之间通过工程师明确定义的接口传递数据。感知输出障碍物列表预测输出行为概率规划输出轨迹点控制输出转向扭矩。整个链条清清楚楚哪里出问题一眼就能定位——是看错了、猜错了、想错了还是动错了。这种架构最大的优势是可解释、可调试。出了事故工程师可以回溯日志看见感知模块把白色卡车识别成了天空导致规划模块认为前方畅通无阻。问题定位明确修复路径清晰——要么改感知算法要么在规划模块加一条兜底规则前方有大面积天空时减速观察。但模块化流水线的代价是什么信息在每个传递环节都在流失和扭曲。感知模块把丰富的视觉信息压缩成前方10米有障碍物这种干巴巴的标签规划模块永远不知道那障碍物是一个纸箱还是一块落石——它只能看到标签。更关键的是每个模块都是工程师用规则和模型手工拼出来的这意味着每个环节都可能成为瓶颈都需要大量人工调优。端到端让数据自己说话端到端的思想简单到一句话既然人类司机看到画面就能直接打方向盘为什么机器不能做法是把原始传感器数据——摄像头图像、激光雷达点云——直接喂给一个巨大的神经网络让网络自己学会从输入到输出的映射。没有感知、预测、规划、控制这些人为划分的模块没有工程师定义的中间接口只有一个黑盒子输入画面输出方向盘角度、油门刹车信号。听起来很疯狂对吧但细想一下这其实是最接近人类驾驶本质的方式。没有人教我们看到红色八角形标志要先识别为停止牌然后查询停止规则再规划停车轨迹最后执行制动动作。我们只是看过足够多的驾驶场景大脑就自动学会了看到这个画面脚就踩刹车。端到端的核心信仰是驾驶行为本质上是一个从视觉到动作的映射函数这个函数太复杂了复杂到人类无法用规则穷尽但数据可以教会神经网络逼近它。Tesla FSD V14就是这条路线的激进实践者。根据公开信息其神经网络参数规模相较上一代提升了十倍——这不是小修小补而是从用模型辅助驾驶到让模型学会驾驶的质的跳跃。BEV鸟瞰图 Transformer Occupancy占据网络这套感知栈已经成为行业新标配本质上就是把感知模块从检测物体升级为理解空间。三种端到端激进、温和与务实但端到端并不是只有纯端到端这一种形态。行业内目前大致分化出三种路线。最激进的是直接端到端传感器数据进控制信号出中间完全没有人为设计的结构。这是一种对数据量的极端信仰——只要数据够多网络就能学会一切。问题是这种路线对数据量的要求高到令人窒息。Tesla全球车队每天产生数百PB的驾驶数据但真正有价值的关键时刻数据仍然稀缺。更重要的是这种系统几乎无法调试——出了问题工程师面对的是一个包含数亿参数的黑盒根本无从下手。温和一点的是模块化端到端网络内部仍然有感知、预测、规划这些子模块的影子但模块之间的接口由神经网络自动学习不再由工程师硬编码。这种方式保留了部分可解释性又避免了人工接口带来的信息损失。Waymo的部分技术路线就带有这种特征——在感知阶段仍然输出结构化信息但规划控制阶段采用端到端学习。最务实的是混合架构端到端负责常规场景规则系统负责兜底。换句话说99%的路况让神经网络自己应对剩下那1%神经网络可能犯错的极端情况用人工规则保命。这种架构承认了端到端的不完美也承认了规则系统在安全底线上的不可替代性。目前大部分声称端到端上车的厂商实际上都在走这条路线。现实困境黑盒、长尾、安全验证问题来了既然端到端听起来这么符合直觉为什么行业争议这么大第一个问题是黑盒不可解释。传统模块化系统出了问题工程师可以逐层排查感知对不对预测准不准规划合不合理端到端系统呢输出错了就是错了你问网络为什么这么开它只能给你一堆梯度下降的数值不会告诉你我误判了那个行人的意图。第二个问题是长尾场景无法穷举。驾驶场景的数量级是多少有人估算过考虑天气、光照、路况、参与者行为等所有变量组合场景空间是天文数字。端到端依靠数据驱动但再多的训练数据也只是这个空间中的一个稀疏采样。人类能凭直觉应对从未见过的场景但神经网络缺乏这种泛化能力——它只能复现训练数据中见过的模式遇到真正的未知表现往往是灾难性的。第三个问题更致命安全验证怎么做。传统系统可以用形式化方法验证某些安全属性变道前必须确认安全距离、遇到红灯必须停车。端到端系统呢你没办法证明这个网络99.999%不会撞人因为网络的行为本身就是数据驱动的概率输出。监管机构怎么批准这样的系统上路出了事故责任怎么界定这些都不是技术问题而是制度问题。更现实的是端到端系统的迭代方式与传统软件完全不同。传统系统发现bug工程师定位问题、修改代码、发布补丁路径清晰可控。端到端系统发现一个corner case表现不好解决方案是什么收集更多类似数据重新训练网络然后祈祷新网络在其他场景不要退化。这种迭代方式对习惯了确定性工程的汽车行业来说简直是一场文化冲击。为什么行业还在投说了这么多问题为什么Tesla、华为、小鹏这些头部玩家还在往端到端上砸钱砸人因为传统路线的天花板已经显现了。过去十年自动驾驶行业的普遍预期是把感知、预测、规划、控制每个模块都做到99.9%的准确率整个系统就能实现安全的自动驾驶。但现实给了行业一记重锤——每个模块99.9%的准确率乘起来意味着每千次驾驶就会出现一次系统失效。更何况在城市复杂场景下模块化系统感知预测的准确率远达不到99.9%。模块化系统更深层的问题是规则是工程师写的而工程师的想象力有限。你可以写一万条规则覆盖一万种场景但第一万零一种场景呢驾驶场景的长尾比任何工程师团队的想象力都要长得多。端到端的核心价值恰恰在于用数据突破人工规则的天花板。人类写不出一百万条驾驶规则但一百万公里的驾驶数据可以让神经网络学会人类无法穷举的行为模式。这就是为什么头部玩家愿意赌——赌的不是端到端没有问题而是赌传统路线已经走到尽头端到端是突破瓶颈的唯一路径。我的判断混合架构是未来十年的现实说了这么多我的立场很简单端到端是自动驾驶的正确方向但纯端到端大规模上车至少还需要五到十年。为什么第一数据量还不够。端到端需要的是覆盖所有corner case的海量高质量数据而目前即使是Tesla真正有价值的关键场景数据仍然稀缺。数据收集、标注、训练、验证的完整闭环还没有哪家公司真正跑通。第二安全体系还没建立。传统汽车行业有成熟的功能安全标准ISO 26262但这些标准都是针对确定性系统设计的。端到端这种概率性输出如何做ASIL等级划分如何做危害分析和风险评估行业还没有共识更谈不上标准。第三责任界定还不清晰。模块化系统出事故可以说是感知模块误检供应商A负责或是规划模块逻辑错误主机厂B负责。端到端系统出事故责任归谁算法供应商数据标注团队训练集群运维这种模糊的责任边界在事故追责时会引发巨大的法律和商业纠纷。所以我的判断是未来五到十年混合架构会是主流落地形态。端到端网络承担大部分常规驾驶任务规则系统在安全底线位置兜底。人类司机学开车驾校教练也会教不确定就踩刹车——端到端系统需要同样的保命机制。纯端到端有一天会上车吗我相信会。但那需要数据量、安全验证、责任体系三座大山都被移走。在这之前那些声称一个神经网络搞定一切的营销话术听听就好——真信了可能就要出事。端到端是革命不是噱头。但革命需要时间需要基础设施的成熟需要整个行业对驾驶这件事的重新定义。在此之前我们看到的所谓端到端量产大多只是在这条路上的早期探索——值得鼓励但不必神话。毕竟真正的革命从来不是靠PPT完成的。
返回列表