Waymo 认为实现完全自动驾驶不能只靠摄像头

Waymo 近期就纯视觉自动驾驶给出了迄今最明确的反对立场。在最近一场 Y Combinator 演讲中被重点提及的发言里,Waymo 联席 CEO Dmitri Dolgov 认为,纯摄像头系统或许可以用于驾驶辅助,或者用来近似模拟人类表现,但如果目标是实现超越人类驾驶员安全水平的完全自动驾驶,这类系统会过早遇到能力上限。

这一观点之所以重要,是因为它触及自动驾驶领域持续时间最长的技术和商业争议之一:仅靠摄像头数据训练的软件,是否最终能够完成全部驾驶任务,还是稳健的自动驾驶必须依赖多种传感器协同工作。Dolgov 的表态将 Waymo 明确置于后者阵营,并将分歧界定为一个并非工程偏好、而是行业究竟要达成何种安全目标的问题。

据引述内容,Dolgov 直接说明了这种权衡。他表示,更多传感器可以提升性能,但也会增加系统复杂度。如果目标只是大致达到人类驾驶水平,或者打造一款辅助产品,那么依赖摄像头可以被视为合理选择。但如果目标是完全自动驾驶,以及他所描述的远超人类的性能,他认为较弱的感知能力会让安全曲线过早变平。

这种表述之所以重要,是因为它重新定义了基准。在这一论点中,人类驾驶并不是上限。人类驾驶是起点,技术栈应当以能否在足够信心下持续超越这一水平来衡量,尤其是在边缘场景和复杂环境中。

Waymo 为何继续押注三类传感器

根据来源材料,Dolgov 的解释是,Waymo 同时使用摄像头、激光雷达和雷达,是因为每一种传感器都能弥补其他传感器的短板。摄像头提供高分辨率和颜色信息,帮助系统以更丰富的视觉方式理解场景。但摄像头属于被动传感器,他表示它们在黑暗和强光眩目环境下会退化。

相比之下,激光雷达可以直接测量车辆周围世界的三维结构。雷达则具备另一种优势:它在雾、雨和雪等环境条件下表现良好,并且能够通过多普勒效应直接测量速度。Dolgov 还强调,激光雷达和雷达都是主动传感器,这意味着它们即使在完全黑暗中,以及在驶向刺眼落日这类极端视觉条件下,也能有效工作。

综合来看,这就是 Waymo 的核心技术论点。一个旨在无需人类接管就能运行的自动驾驶系统,不应过度依赖单一感知通道,尤其是在该通道容易受到常见现实世界失效模式影响时。该公司的立场是,传感器多样性不是可有可无的冗余,而是让车辆在某种感知方式失效时仍能保持态势感知的机制。

这是一种比在有利条件下识别车道、车辆和行人更严格的标准。它默认系统要部署在一个混乱的现实世界中,在那里光照会迅速变化,天气会干扰可见性,道路参与者行为难以预测,而罕见但后果严重的情况与日常场景同样重要。

更深层的行业分歧在于产品类别

Dolgov 的表态也表明,围绕自动驾驶的一些争议,实际上是对产品类别的争议。驾驶辅助系统和完全自动驾驶系统从外部看可能相似,但它们可以基于对故障、责任和可接受性能余量完全不同的假设来构建。

如果人类驾驶员仍然负责并保持注意力,那么系统在遇到不确定性时可以把问题交回去。如果车辆本身需要承担全部任务,不确定性就必须在机器自身的感知和决策栈内得到解决。Waymo 似乎认为,这正是以摄像头为主或仅靠摄像头的方案变得不够用的地方。

这种分歧的商业层面同样重要。硬件越多,通常意味着成本更高、集成工作更多,并且维护复杂度也可能上升。长期以来,纯视觉支持者一直主张,更简单的硬件可以更高效地规模化。根据所提供的原文,Dolgov 的回应是,成本和复杂度问题不能与安全目标分开看待。更便宜的感知方案可能很有吸引力,但前提是它仍能支撑预期的自动驾驶水平。

因此,这不仅是一场关于哪种传感器更优雅的技术争论,更是一场战略层面的讨论:更低成本的感知栈,是否能在剩余问题变得罕见、棘手且涉及安全时继续进步。

这些表态对自动驾驶竞赛意味着什么

原文将 Dolgov 的言论描述为对 Tesla 路线的直接挑战,但从所给材料出发,更稳妥的结论其实更广泛。Waymo 正在传递一个信号:它认为多模态感知是自动驾驶下一阶段的关键,而且它相信通向可靠无人驾驶性能的道路,依赖的是互补感知,而不是尽可能少的硬件。

这并没有终结行业争论,但它让争论更加清晰。问题不再只是车辆能否在很多场景下自己开动。问题在于,当最容易的提升已经用尽,而剩下的错误来自黑暗、强光、天气、运动歧义或道路上的异常几何结构时,某种架构是否还能继续进步。

通过强调“安全曲线过早变平”这一概念,Waymo 认为弱感知的问题不仅仅是今天会让系统更差。更深层的问题在于,在其看来,这会限制系统明天还能进步到什么程度。

对于更广泛的交通和能源生态系统而言,这一区别很重要。自动驾驶汽车常常被讨论为软件突破,但要实现大规模部署,同样取决于机器在压力条件下能否稳定感知。Dolgov 的言论强化了这样一种观点:硬件选择仍然是自动驾驶商业模式和安全论证的核心。

从这个意义上说,Waymo 的信息很直接:如果行业追求的是真正无人驾驶系统,而不是更高级的辅助驾驶,那么感知栈就必须为人类视觉,以及由此延伸出的纯摄像头感知,单独不足以应对的条件而设计。

本文基于 CleanTechnica 的报道。阅读原文

Originally published on cleantechnica.com