深度学习在安全自动驾驶中的挑战与未来
深度学习在安全自动驾驶中的应用:当前挑战与未来方向
摘要
信息和信号处理技术的进步对自动驾驶(AD)产生了重大影响,在先进人工智能(AI)技术的帮助下,提高了驾驶安全性,同时减少了人类驾驶员的操作负担。近年来,深度学习(DL)方法解决了多个复杂性质的实际问题。然而,其在自动驾驶控制过程中的优势尚未得到深入研究和突出展示。本综述强调了深度学习架构在可靠性与高效实时性能方面的潜力,概述了安全自动驾驶的最新策略及其主要成就与局限性。此外,本文涵盖了深度学习在自动驾驶流程中的主要体现形式,包括感知、分析和执行阶段,重点涉及通过感知和基于视觉的深度学习方法实现的道路、车道、车辆、行人、疲劳检测、碰撞避免以及交通标志检测。同时,我们使用不同的评估指标讨论了所综述的多种方法的性能,并对其优缺点进行了评述。最后,本综述指出了基于深度学习的安全自动驾驶当前面临的问题,并提出了未来研究建议,为初学者和希望进入智能交通系统这一活跃领域的研究人员提供了参考材料。
一、引言
RECENTLY ,在用于执行各种简单和复杂任务(包括目标检测[1],、定位[2],、跟踪[3],以及活动识别[4])的车载传感器开发方面已报告了显著进展,这些进展广泛应用于多个领域。此类进步提升了自动驾驶(AD)[5]的感知与计算能力。尽管如此,由于自动驾驶具有高度敏感性,并在减少事故数量和拯救人类生命方面发挥关键作用,仍需工业界和学术界给予更多关注。例如,仅在美国,每年平均发生600万起汽车事故,其中约300万人受伤,约200万人遭受永久性伤害[6]。除受伤外,每天更有超过90人死于汽车事故。造成这些事故的主要原因包括酒驾(40%)、超速行驶(30%)和鲁莽驾驶(33%)。同样,分心驾驶也会导致大量事故[7]。据一份报告显示,美国每天有超过9人因分心驾驶而死亡[8],此外,每年有超过1060人因驾驶员分心而在碰撞事故中受伤。通过使用无人驾驶车辆技术作为驾驶员的辅助工具或实现完全自动化,这些事故可大幅减少。此外,残障人群也将从这一技术中获益匪浅[9]。
由于自动驾驶带来的广泛益处,世界各国政府和企业都对其产生了浓厚兴趣。例如,前二十五个国家在[10]中被评估了自动驾驶准备情况,并在政策与法规、技术与创新以及基础设施方面获得了评分。如图1所示,新加坡在政策与法规方面领先,以色列在技术与创新方面领先,荷兰在自动驾驶基础设施方面领先。像阿联酋这样拥有良好基础设施的国家,在其道路上运行自动驾驶时,却受限于先进技术的发展。
文献表明,根据国际汽车工程师学会(SAE International)标准定义,自动驾驶汽车具有五个不同的自动化等级,范围为 0∼5[11]。这种基于等级的发展路线在图2中进行了可视化展示。0级车辆完全由驾驶员控制[12]。1级允许汽车执行加减速或转向等少量操作,其余控制由人类驾驶员负责,例如自适应巡航控制[13]。2级汽车可以采取一些安全措施,如紧急制动,但驾驶员在驾驶时仍需保持警惕。特斯拉自动驾驶系统或日产ProPilot可被视为2级,因为它们能够使汽车保持在期望的车道内。在3级情况下,汽车可通过监测周围环境在特定条件下自动行驶,但如果自动驾驶系统发生故障,人类驾驶员仍需随时准备接管控制权[14]。奥迪声称其配备交通拥堵辅助系统的A8车型具备3级能力。对于4级汽车而言,如果其请求人为干预未得到响应,车辆仍能安全地接管并继续行驶[15]。4级汽车不建议在不确定的天气状况或未绘制地图的区域行驶。最后,5级车辆可在所有条件和模式下实现完全自动化[16]。
迄今为止,主要工业界已发起多项努力和倡议,以推动自动驾驶技术的成熟。例如,著名的DARPA大挑战赛要求使用无人驾驶汽车行驶150英里道路,但在该次挑战赛中,所有15辆参赛车辆均未能完成任务。此后技术得到进一步改进,在2005年的比赛中,23名参赛者中有5名成功完成了挑战。另一项赛事“DARPA城市挑战赛”于2007年启动,其中有六名参与者完成了任务。其他值得关注的事件包括“智能车辆未来挑战赛”(2009∼2013)、“现代自动驾驶挑战赛”[20] 2010,以及“公共道路城市无人驾驶汽车测试”[21], 2013。最近,在 2015∼2016,谷歌自动驾驶汽车和特斯拉自动驾驶系统[22]作为商业化案例被推出。除了这些里程碑之外,多家著名公司还计划在不久的将来发布不同级别的自动驾驶汽车。例如,福特计划在2021年交付一款“4级”无人驾驶汽车。同样,宝马的目标是在 2021[23]推出“4级”或“5级”自动驾驶汽车。
尽管取得了上述成就,但仍有若干问题限制了自动驾驶技术的广泛应用,诸如人工智能(AI)方法的成熟度——特别是依赖于深度学习(DL)的视觉传感器方法、自动驾驶系统各组成部分的性能依赖性,以及大规模的社会接受度[24]等环境因素。其中,前两个方面是自动驾驶系统的重要组成部分和关键推动因素,可显著提高其安全性,从而获得广泛的社会认可。事实上,安全性是自动驾驶的关键要求,有助于辅助驾驶员并最小化潜在事故的风险。这一要求主要通过七项关键任务来保障,包括道路检测[25],、车道检测[26],、车辆检测[27],、行人检测[28],、疲劳检测[29],、碰撞避免[30],和交通标志检测[31],针对这些任务已提出了大量手工设计和基于学习表示的方法。现有文献涵盖了自动驾驶传统方法在不同方面的综述,如规划与控制[32],、交通灯识别[33],和车辆定位[34]。许多研究还强调了深度学习在智能交通系统领域[35]–[38]中的关键作用。然而,目前尚缺乏对用于安全自动驾驶的深度学习方法的详细研究,而该研究被视为自动驾驶及其安全性的核心基础。
本综述旨在通过分析与上述七项安全自动驾驶任务相关的最新深度学习研究,填补这一文献空白。我们将这七项任务归纳为一个包含感知、分析和执行的三步流程,并列举了各项任务的主要成就和关键局限性。我们的工作还强调了安全自动驾驶的当前问题,并提出了若干研究建议,重点关注提升深度学习方法在真实车辆环境中应用的适用性,且以安全性为首要要求。我们对现有文献进行了批判性分析,并补充了不同深度学习模型架构在多个与安全相关的自动驾驶任务上的实证结果摘录,揭示了这些模型的巨大潜力。最后,我们讨论了深度学习领域中至今仍研究不足的当前研究领域,尽管这些领域与该特定应用领域的安全性问题有着直接关联。
本文的其余部分结构如下:第2节简要描述了自动驾驶的主要控制过程。第3节详细介绍了近期的深度学习方法及其在自动驾驶系统中的优势与局限性。第4节讨论了安全自动驾驶的主要挑战,第5节提出了未来方向。第6节总结了本综述,并给出了结论和展望。
II. 自动驾驶的主要体现形式及相关研究
本节旨在简要描述感知、分析和执行(MAE)的三步流程,并介绍与自动驾驶相关的若干研究。“感知”指通过传感器、摄像头或雷达对周围环境进行数据采集,并处理以检测道路、车道、车辆、行人等,[39]。为此,本综述中所有与这些任务相关的方法将归入“M”部分。“分析”阶段则采用更高级的
三、自动驾驶任务的关键文献分析
在本节中,结合目标七项任务,简要描述了表二中提到的最先进的深度学习方法。尽管目前有许多关于自动驾驶系统不同组成部分(如感知、图像处理和通信等)的研究,这些部分共同协作以实现车辆的自主驾驶,但由于某些部分对这类车辆的整体性能具有重大影响,因而受到了更多关注。其中最重要的部分是与MAE相关的七项任务,相关研究将围绕这些任务展开如下探讨:
A. 道路检测
该任务旨在检测自动驾驶车辆可能行驶的圆形边界和区域。在此背景下,选定了四项代表性工作。第一个框架[52]应用卷积神经网络来估计远距离道路走向,用于增强现实应用。第二个研究了级联端到端卷积神经网络(CasNet),用于在复杂背景以及树木和汽车严重遮挡的情况下实现精确的道路检测与中心线定位,如[53]所示。其他工作提出了一种基于孪生全卷积网络的框架,使用RGB图像、语义轮廓和位置先验精确检测道路边界[54],以及一种称为 RBNet的完全端到端模型[55],用于在单个网络中进行道路存在性及边界检测。
B. 车道检测
车道检测通过车道保持和车道偏离控制系统,在确保自动驾驶汽车安全性方面起关键作用,使其保持在指定车道上,最小化碰撞可能性。在此背景下,选取了四种近期深度学习方法作为示例。第一种方法中,[56]利用多传感器数据,并将其输入用于三维空间车道检测的深度神经网络。第二种方法研究了波形和卷积神经网络,用于检测用于安全自动驾驶的车道标线,具体讨论见[57]。第三项工作中,提出了一种节能型车道检测与分类策略,采用立体视觉和卷积神经网络实现自车横向定位,并为安全自动驾驶发出前向碰撞预警[58]。在接下来的工作[59],中,使用循环神经网络进行道路车道检测,从而同时确保车道检测和碰撞避免。
C. 车辆检测
为了避免可能的事故,自动驾驶汽车需要检测并跟踪道路上的其他车辆。为此,它需要估计周围车辆的不同方面,例如其形状、相对速度、尺寸和三维位置。在此背景下,一些最先进的技术被作为近期文献中的示例进行描述。第一种是使用卷积回归进行车辆检测与计数的自动方法
D. 行人检测
车辆与行人事故是一种常见场景,大多发生在道路上。对于自动驾驶汽车而言,它由于人类具有更高的重要性,因此有必要将人类与其他物体区分开来。因此,在自动驾驶汽车上安装了视觉摄像头,用于行人的检测、跟踪和可能识别,以避免碰撞及其他多种目的。例如,Ouyang et al.[63]提出了一种联合框架,结合深度特征提取、形变与遮挡处理以及行人检测分类,有助于提升自动驾驶安全性。Cai et al.[64]提出的另一种方法,制定了面向复杂度感知的级联训练用于行人检测。他们将级联与卷积神经网络相结合,实现了更快速度下的精确行人检测。类似地,Wang et al.[65]通过研究身体部位语义和上下文信息,并结合复杂的遮挡处理,提出了一种行人检测方法,获得了高精度定位结果,从而提高了自动驾驶安全性。
E. 疲劳检测
该任务与驾驶员相关,尤其适用于1级到3级自动驾驶汽车,因为4级和5级车辆是完全无人驾驶的。这是安全应用的关键因素之一,因为一旦检测到驾驶员分心或出现疲劳状态,系统便可自动采取必要措施。为此,文献中已存在多种方法。例如,Lyu et al.[66]提出了一种基于多粒度的深度框架,通过智能使用卷积神经网络和长短期记忆网络实现视频中的疲劳检测。Vijayan和Sherly [67]提出了三种卷积神经网络架构,包括ResNet50、VGG16和InceptionV3,用于第一人称驾驶员视频中的疲劳检测。这些模型通过使用特征融合架构层进行融合后共同训练。Parket al. [68],采用了类似的方法,将AlexNet、VGG‐FaceNet和FlowNet所获得的结果进行集成用于疲劳检测的连接层。在另一项类似的研究中,Guo和Markoni [69]研究了卷积神经网络和长短期记忆网络在疲劳检测中的应用。
F. 碰撞避免
从之前的任务可以明显看出,自动驾驶汽车能够跟踪和检测与其相关的重要物体,但这些信息还不足以做出决策。重要的决策和行动由碰撞避免系统来完成。因此,这是一个高层级任务,自动驾驶安全性在很大程度上依赖于此,目前已有大量研究致力于这一方向。例如,Song et al.[58]能够通过采取必要措施同时检测车道并避免碰撞。类似地,Nguyenet al.[70]提出了一种系统,该系统可检测障碍物,并使用基于自编码器、TCNN和R‐TCNN的深度学习架构对其进行识别,以及最终跟踪它们以避免自动驾驶过程中的碰撞。在另一种方法中,Long et al.[71]提出了一种基于噪声传感器测量数据、利用深度神经网络的新型端到-end碰撞避免系统。
G. 交通标志检测
该任务主要涉及在斑马线和道路交叉口控制车辆避免碰撞,在速度突变区降低速度,在转弯前通知驾驶员,并提出建议关于掉头等。其功能虽然简单,但在决策方面却非常重要且具有挑战性,这一点在多项研究中均有讨论。例如,Zhu et al. [72]提出了一种基于目标提议的交通标志检测与识别框架。通过卷积神经网络缩小交通标志的搜索区域,然后使用区域卷积神经网络和EdgeBox方法进行检测和分类。Li et al.[73]提出了一种针对车载摄像头的交通信号灯识别模型,该模型利用前一帧信息来保留前一帧的内容检测记录并聚合分析帧间信息的通道特征。王和周[74]使用轻量级深度学习模型在动态图像中识别交通信号灯标志。提出了一种双通道机制用于暗帧中的交通灯检测,并开发了一种轻量级卷积神经网络模型以实现实时分类。针对暗通道显著性模型,设计了可同时提取不同颜色光源的方法。Jensen等[75]应用实时目标检测算法,采用多种 YOLO版本进行交通信号灯标志检测,在具有挑战性的基准数据集上取得了最先进的结果。Ouyang等[76]使用启发式候选区域选择模块进行交通信号灯标志识别,并开发了一种轻量级交通灯检测(TDL)模型用于分类。该模型在自采集数据集和基准数据集上进行了评估,同时通过离线仿真和实车道路测试进行了验证。该模型集成于英伟达 Jetson平台,在公交车和汽车上于正常交通条件下进行了实车测试。Yuan等[77]提出了用于交通标志检测的 VSSA‐NET架构,将其视为回归与序列分类任务。该网络架构基于垂直空间序列注意力和多分辨率特征学习模块,并通过带注意力机制的回归与分类提取上下文信息。类似地,Tabernek和Skoˇcaj[42]采用Mask R‐CNN目标检测算法,并对网络进行不同适应性调整以实现最终检测。为了提升性能,将外观和几何畸变分布作为数据增强手段来扩充数据。这些任务均有助于提升自动驾驶安全性,因此研究人员正日益关注这些领域。
IV. 安全自动驾驶的性能评估
本节针对应用于与自动驾驶安全性密切相关任务的最先进的深度学习模型,对其性能进行了对比。每个任务均使用多种评估方法进行评价,包括F值、精确率、召回率、总体准确率、平均精度(AP)、曲线下面积(AUC)以及运行时间。然而,我们仅讨论了通过共同评估标准获得的那些评估结果。例如,大多数道路检测技术均使用F值评分进行评估。F值也被称为F1分数,它同时考虑精确率和召回率,计算两者的调和平均值,从而反映两者之间的权衡关系。其可通过公式(1)中的公式进行计算。
F1= 2× Precision × Recall / (Precision+ Recall) (1)
同样,车道检测的主流技术使用AP和AUC进行评估。AP(也称为平均平均精度(mAP))是用于目标检测器的性能评估指标,通过在不同召回率(式3)水平下的精确率(式2)计算AP值。更一般地,AP用于计算精确率‐召回率曲线在0到1范围内的面积。
Precision= True positive / (True positive+ False positive) (2)
Recall= True positive / (True positive+ False negative) (3)
同样,AUC值用于人工智能模型的分析,通过绘制真正例与假正率的关系,以确定训练好的模型在哪个阈值下表现最佳。图4(a)展示了不同深度学习模型在KITTI的[78]基准数据集上取得的最先进结果。该数据集是用于道路检测、车道检测、道路上的行人检测和车辆检测等自动驾驶任务的具有挑战性的数据集之一。该数据集分为三个集合:城市标记(简单)、城市多标记车道(中等)和城市无标记(困难)。此外,它包含289张训练图像和290张测试图像。例如,RBNet [55]取得了当前最高的F值评分。该模型采用五个卷积层和深度卷积神经网络进行特征提取,并结合后处理实现道路边界检测。该模型训练了100k个训练轮次,学习率为0.01,每帧处理时间为0.18秒。DNN [79], s‐FCN‐loc [54],和上卷积 [80]分别取得了 93.43%、93.26%和93.83%的F值评分。此外,DNN [79]和s‐FCN‐loc [54]采用了非常深的卷积神经网络架构,并结合复杂的后处理。因此,它们每帧的处理时间分别为2秒和0.4秒。
上卷积 [80] 每处理一帧仅需 0.083 秒,但其准确性低于 RBNet [55]。图4(b)展示了使用AP分数和AUC值对当前最先进的车道检测方法进行比较的结果。他们使用Caltech车道数据集[83]进行实验,该数据集包含在帕萨迪纳繁忙街道上拍摄的1225张具有挑战性的图像。SCNN [81]和DMS [56]采用AP分数来评估其技术,分别取得了59.5和84.7的分数。SCNN [81]采用VGG16卷积神经网络架构作为其后端,并增加了三个全连接层用于道路检测。他们使用 “poly”学习率策略,以0.01的学习率和0.0001的权重衰减训练了该扩展模型。由于采用VGG16作为主干网络,该模型需要0.115秒的处理时间,因此无法高效地进行实时处理。类似地,Li et al.[82]采用了两个卷积层和全连接层的架构,并结合多任务目标检测,其中第一项任务检测目标,第二项任务估计几何输出。他们在从全连接层提取特征后,尝试了RNN、CNN和支持向量机进行多任务学习,其中RNN表现最佳,达到了最高的AUC值0.99。我们在图中将0.99表示为99,因为AUC值范围在0到1之间。然而,由于图形表示的需要,这些分数经过归一化处理以便更好地可视化。
图5中给出的行人检测技术已在KITTI的[78]基准数据集上使用mAP分数进行了评估。在最先进方法中,选择了三种场景进行行人检测评估,即基准数据集定义的 “简单”、“中等”和“困难”场景。在简单场景中,目标的最小边界框高度为40像素,且目标完全可见,无任何遮挡。在中等难度场景中,最小边界框高度为25像素,目标部分被遮挡。在困难场景中,目标被严重遮挡且难以观察,其边界框的最小高度也为25像素。对于简单、中等和困难数据,F‐PointNet [85]分别取得了87.81、77.25和74.46的最大mAP分数。他们采用了2D和3D卷积神经网络架构及其融合方法进行行人检测。MM‐MRFC [86]利用了颜色、运动和深度特征,取得了第二高的准确性以及每帧处理时间为0.05秒。在简单场景下,最先进方法的整体性能约为85%,中等场景下低于70%和80%,困难场景下则低于65%。因此,对于安全可信的自动驾驶而言,这是一个极具挑战性的问题,行人检测的准确性应在简单、中等和困难级别上均达到人类感知水平。
与行人检测类似,车辆检测的评估也在KITTI的[78] benchmarkdataset的简单、中等和困难场景下进行,如图6所示。这些方法在车辆检测方面的评估使用了AUC值。主流方法在简单情况下表现良好,其中3DOP [87],在中等和困难情况下分别达到了88.64和79.27的最大AUC值,由SubCNN [89]实现。3DOP [87]编码了物体尺寸先验、地面平面以及多种深度感知特征,用于推理自由空间、点云密度和到地面的距离。他们采用了结构化SVM,该方法接收输入‐输出对,并通过其提出的优化函数学习参数。SubCNN [89]利用了两个基于Fast R‐CNN的非常深的卷积神经网络架构:1)区域提议网络和2)目标检测网络。文章未讨论处理时间,但普遍认为基于多个卷积神经网络的方法由于计算复杂度高,不适合实时处理,因此在自动驾驶中的应用受到限制。
Overall accuracy= Number of correct predictions / Total number of predictions made (4)
疲劳检测使用总体准确率指标进行评估,知名深度学习方法的结果在图7中进行了比较。总体准确率告诉我们 “在所有测试样本中,正确映射的比例是多少”,如公式 4所示。总体准确率通常以百分比表示,100%准确率为完美模型。即使是人类,疲劳检测也是一项非常具有挑战性的任务,人类在白天和夜间场景中的平均准确率仅为80% [68]。FFA达到了75.57%的最大准确率,这是在疲劳检测中达到了迄今为止最高的准确率。此外,AlexNet [91],、VGG‐FaceNet [92],、LRCN [93],、FlowImageNet [93],和DDD‐FFA [68] 分别实现了 65.85%、67.85%、61.5%、62.99%和70.81%的准确率。AlexNet [91]和VGG‐FaceNet[92] 是非常深的卷积神经网络架构,分别包含 6000 万和 1.38 亿个参数,对于像自动驾驶这样的实时任务而言效率不高。FlowImageNet [93] 最初是为动作识别训练的,但经过微调用于从输入图像序列中识别疲劳状态,如面部和头部姿态。它包含五个卷积层和两个全连接层,在微调过程中最后一层从 101 类更改为 4 类。该模型速度快,但对于可信赖的自动驾驶而言效果仍不够理想。DDD‐FFA [68] 和FFA [67]通过集成三个 CNN 模型全连接层中的特征来进行疲劳检测。该策略提高了总体准确率,但处理时间也增加了三倍。驾驶过程中的疲劳非常危险,是导致事故的常见原因。因此,未来的研究应致力于提高其准确性,以实现安全自动驾驶,同时关注预测建模中常被忽视的其他方面,例如模型输出置信度的量化、模型所捕获知识的可解释性以及预测的可追溯性。由于安全的自动驾驶决策可能关乎人类生命安全,因此为了满足监管限制的要求,解释模型在其输入中观察到什么内容以生成输出成为其可行性的关键因素。
用于交通标志检测的主流技术通过精确率、召回率和交并比(IOU)进行评估。使用不同模型在瑞典交通标志数据集(STSD)[94]上取得的精确率和召回率如图8所示。STSD是一个极具挑战性的数据集,包含19236张图像,涵盖20个交通标志类别。R‐CNN [72],、FCN [72], 、 Faster R‐CNN [42], 、Mask R‐CNN [42],、MR特征 [77], 和 MR特征 +VSSA [77] 分别取得了91.2%、97.7%、95.4%、97.5%、98.83%和99.18%的精确率,以及87.2%、92.9%、94.6%、96.7%、93.96%和94.42%的召回率。由于该任务更侧重于检测而非分类或识别,研究人员采用了交并比(IOU)。IOU通过比较检测到的边界框与真实标签的区域重叠程度来评估结果。较高的交并比意味着较好的检测效果。
V. 安全自动驾驶中的挑战
尽管学术界和工业界在自动驾驶技术上投入了大量资源,但由于存在诸多挑战,这些系统的某些方面仍然面临困难,具体如下所述:
a) 自动驾驶系统复杂性
自动驾驶系统由一系列决策问题组成,其中一个问题的解决方案是另一个问题的输入。尽管某些部分已有显著改进,但整体上各个部分仍依赖于整个自动驾驶系统的性能[98]。例如,弗达和弗拉契奇[99]提出了一种多准则决策方法来选择最合适的驾驶动作,其中决策被划分为连续阶段。他们方案中的第一阶段是安全关键的。然而,还需要做出多个类似人类思维的决策。因此,高效的自动驾驶运动规划器只能与高能耗反馈控制器兼容。另一方面,简单控制器可能鲁棒性较差[100],所需能量较少,但需要非常详细的运动规划方法。因此,需要开发智能框架以平衡此类冲突指标,并实时得出最优解。
b) 道路环境动态性
可以认同的是,由于道路上显著的道路数字化、彩色广告和照明,当前城市正变得越来越动态。研究人员提出了基于多传感器的解决方案,包括雷达[101]、视觉[2]、激光[102]、以及其他不同模态的解决方案[103],但在道路场景的动态性条件下,其准确性水平仍然很低。此外,人类更倾向于拥有个人豪华车辆,这增加了道路的交通量。这些因素使得自动驾驶汽车的环境更加复杂,从而通过影响与自动驾驶相关的检测、跟踪和识别任务的准确性,进一步加大了挑战。
c) 大数据与实时处理
使自动驾驶汽车能够充分感知其周围环境,在该环境中,安装了多种传感设备,包括传感器[104]、摄像头[2]、激光雷达[105]等,持续采集数据,从而产生大数据。此外,考虑到自动驾驶的关键性,还会收集高质量数据[106]–[108](例如高分辨率视频)。因此,在准确性、功耗和成本[109]的约束下,实时处理如此庞大的数据量是一个重大挑战。
d) 智能数据优先化
如前所述,会捕获大量不同性质的数据,从而形成大数据。文献表明,自动驾驶汽车处理所有捕获的数据是不可行的,因此需要一种数据优先机制[110],[111]来筛选出仅重要的内容进行进一步处理,并丢弃不必要的数据。该优先机制应具备足够的智能性,以在不同的环境场景[112]中对各种捕获的数据进行优先排序。
e) 鲁棒性与适应性
研究[56]–[65]表明,在特定环境中为自动驾驶汽车采集和处理数据相对容易。大多数用于自动驾驶的主流人工智能技术都是基于特定环境收集的数据进行训练的,在跨天气条件下并不可靠。谷歌团队最近遇到了这一问题,并提出了全天气自动驾驶汽车的概念。然而,当环境不确定且捕获的数据受到雪、雨[113]和雾[114]影响时,这一任务本身就变得极具挑战性。因此,与平均绝对误差相关的不同任务系统应具备足够的鲁棒性,以适应周围环境。
f) 用于动态决策的感官数据集成/融合
在实际应用中,使用单个传感器很难实现理想的性能和目标准确性。因此,广泛使用决策算法来处理从多传感器[115],[116]获取的融合数据。自动驾驶汽车中使用了两种主要类型的传感器,即环境感知和定位。环境感知用于检测车辆周围的物体,而定位则跟踪车辆的位置。融合算法分为两类:1)机器学习方法(深度神经网络)和2)用于测量状态的多传感器信息融合,例如卡尔曼滤波(KF)。文献中提出了许多基于传感器融合的模型,使用了各种传感器和融合算法。这些框架主要关注提高准确性,但这些方法的实现可行性研究较少。自动驾驶中的主要挑战包括感知、实时计算与通信以及基于学习的控制方法。对于自动驾驶汽车[117]而言,基于融合的高效、轻量化且鲁棒的流水线仍有巨大的发展空间。
g) 自动驾驶中深度学习的公平性、问责性与透明性
近期研究强调了在人工智能模型的决策最终产生影响的情境中,解释这些决策的极端必要性,对人类生活(如健康、法律等)产生影响[118],[119]。自动驾驶利用深度学习方法也不例外,尤其由于这类人工智能模型具有黑箱特性,因此对模型可解释性提出了要求。借助可解释人工智能(XAI)技术[120],不仅能够揭示深度学习模型的内部机制及其所学知识,还能便于对错误决策进行可追溯性和事后分析(问责制),从而支持模型优化。同样,确保用于自动驾驶的深度学习模型[121]不受严重不平衡或稀疏的训练样本影响(即避免模型偏差),有助于提升泛化性能,进而增强车辆的情境感知能力,并符合潜在的监管约束[122]。通过XAI技术解读模型所学内容并构建合理的反事实,有望界定模型的性能边界,揭示潜在的偏差来源,并分析决策过程以发现模型中的潜在缺陷。如果没有在模型可解释性方面的进步,自动驾驶功能即便依托于深度学习强大的建模能力,也难以实现实际应用。
h) 自动驾驶中的在线学习能力
自动驾驶中的一个主要挑战是使用可扩展模型来应对各种环境。例如,为城市环境训练的模型可能不适用于农村地区,因为这两种场景下的交通规则有很大差异。同样,由于新建设的区域、天气状况和气候变化等原因,也会出现类似情况,[123]。该问题可通过在线学习策略(利用新数据更新模型)来解决。最近,研究人员已在许多领域应用了在线学习策略,例如监控[124],其中深度模型通过新数据进行迭代微调,并更新已训练模型的参数以适应变化的环境。类似地,基于可达性的安全在线学习保证(GSOLR)[125]、随机在线学习[126]和通过元学习的在线学习[127]是最近提出的方法,可用于自动驾驶汽车中的在线学习,以根据地图、天气状况和视觉变化相应地更新不同的深度模型。
i) 对抗攻击下的鲁棒性
与上述情况类似,近期人们广泛讨论了深度学习模型在面对精心设计的样本时的弱点,即使这些样本在视觉上不可察觉,也会导致模型做出错误决策(例如误分类[128])。对抗性攻击在车辆领域带来了巨大挑战,已有实例表明,由于可打印贴纸形式的物理对抗性修改,车载摄像头对交通标志进行了错误分类[129]。尽管当前针对对抗性攻击的防御策略研究十分活跃,但在确保其有效性符合设计规范和可接受的风险限值方面,仍有很长的路要走。
j) 交通标志牌的变异性
目标检测模型通常使用固定尺寸分辨率数据进行训练。然而,大多数交通标志显得非常小,当高分辨率图像被缩放到模型所需的输入尺寸时,大型标志牌可以在缩放后的图像中被轻松捕捉,但这会导致小型交通标志牌的误检问题[42]。此外,当车辆以非常高的速度(例如100公里/小时)行驶时,这种高速摄像机运动破坏了小型标志牌的结构。因此,检测与识别各种类型的交通标志牌是一项极具挑战性的任务,可能通过将高分辨率图像而非缩放后的图像作为模型输入来实现。
六、未来研究建议
鉴于第5节和文献中提出的挑战,本文列出了安全自动驾驶领域内一些重要的进一步研究方向,并为工业界和学术界提供了简要说明。在这些方向上的改进可以提升自动驾驶系统的重要性,并有助于提高其安全性和可靠性。
a) 节能型卷积神经网络(CNN)
多项研究表明,卷积神经网络在与自动驾驶相关的各种计算机视觉任务中取得了最先进方法的成就,例如跟踪[2],[130]、速度控制[76]和障碍物避让[131],[132]等。然而,其较高的内存需求和计算复杂度限制了它们的应用。因此,应设计节能且高效的CNN模型,以提高自动驾驶技术的驾驶安全性。
b) 自动驾驶的强化学习
强化学习(RL)是自动驾驶多个领域中的一个活跃研究重点,例如控制[133],[134]和路径规划[135],[136]。毫无疑问,强化学习技术已达到了良好的性能水平,展现出这些技术在学习近似最优策略方面的能力,从而有效运行自动驾驶汽车的不同子系统。然而,文献中迄今报告的大多数研究成果都是在各种仿真器或受限试验环境中进行的,原因多种多样,从既有的监管限制到车辆原型的可获得性,或是研究结果尚处于早期阶段。因此,当前的RL模型无法完全应对充满不确定性的真实世界环境,这阻碍了安全性保障[137]的提供。尽管仿真器能够以较低成本生成驾驶场景,但模型是在虚拟环境中离线训练的,无法期望其在真实条件下同样高效地运行,最终也无法直接部署。因此,需要进一步研究以确保RL模型在模拟和真实环境中应用时具备良好的泛化能力。为此,近期应关注若干方向,例如提升车辆仿真软件所达到的真实感水平(例如,城市场景的程序化生成)、数据增强方法的最新进展(例如,在驾驶测试采集的数据上叠加不同的气象条件),或专门旨在提升RL模型对未见环境和/或任务泛化能力的算法方案(元强化学习[138],最近在智能交通系统领域已出现初步研究成果[139])。
c) 用于自动驾驶的序列学习与生成对抗网络
安装在自动驾驶汽车上的视觉传感器会捕捉行人执行不同活动的画面。这些活动的模式无法从单个帧中获取,而需要通过对连续帧序列[124]进行学习才能捕捉。这一增强的信息基础需要高效的技术来处理,考虑部分遮挡或随时间变化的不同摄像头角度等额外复杂因素,针对自动驾驶汽车周围环境中的行人行为识别进行序列学习。为此,能够将这些效应融入序列学习模型构建数据中的数据增强技术,成为一条值得探索的可行路径。同样,可以研究生成对抗网络(GAN)以在仿真中生成精确的环境,用于训练自动驾驶汽车策略。GAN能够学习从不同视角重新渲染场景,这有助于为强化学习方法构建新的学习环境,并最终为自动驾驶汽车生成更具泛化能力的策略。
d) 可靠高效的运动规划器和反馈控制器
运动规划器和反馈控制器是自动驾驶系统的关键组成部分之一,因为它们在整个系统的运行时间中起着关键作用[140]。然而,它们的工作方式与第4节中描述的相反。因此,需要进一步研究以提出一种能够在计算负担、速度和安全性之间取得平衡的可靠且高效的运动规划器和反馈控制器[141]。
e) 通用基准数据集
尽管已有用于评估自动驾驶系统不同单独方面的数据集[142]–[145](如KITTI基准[78]和公开可用数据集[146]),但仍需建立通用基准数据集来衡量自动驾驶原型的整体性能。此类努力将使自动驾驶成为学术界和工业界关注的热点,有助于开展基准测试并组织相关研究社区的竞赛,从而改进自动驾驶系统的各个单独方面以及整体性能。
f) 产业化与个性化
尽管当前正在积极开展大量研究以改进自动驾驶的几乎所有方面,例如跟踪[147]–[149]、速度控制[150],[151]、定位与建图[34],[152]、路径规划[153]–[156]以及视觉引导[98],[43],但由于安全风险和缺乏大规模产业化,此类系统尚未获得全球范围的认可与采纳。因此,应使自动驾驶模型足够成熟,以实现全球范围内的信任和大规模应用。此外,个性化(例如针对巡航控制[157]和车道偏离[158],[159]的初步探索)可能是另一个有趣的研究方向,使用户能够根据自身在安全性、速度限制、可用功能和成本方面的偏好进行调整。例如,谷歌和英伟达等公司正在开发强大的基于人工智能的自动驾驶汽车,并投入资源研发专用的高性能GPU和TPU设备,用于高效运行本研究中提到的深度学习模型。
g) 自动驾驶汽车的边缘计算
为了保证自动驾驶的安全性和鲁棒性,自动驾驶汽车配备了多种智能传感器和高性能计算嵌入式设备。这些传感器采集的数据通过深度学习模型进行处理,以实现精确决策。在此背景下,主要挑战之一是恰当地平衡处理设备的成本与计算模型能力之间的权衡[160],[161]。通常情况下,制造业优先以最低成本制造具备最大性能的传感器[162]。这为边缘计算在安全自动驾驶中的应用开辟了前所未有的机遇。面向深度学习的边缘计算[163]需要研究在边缘端进行在线训练,因为车辆数据随时间动态变化[164]。传统训练过程通常在具有高计算资源的设备上完成,然后将训练好的模型部署到边缘设备上。然而,对于与自动驾驶相关的任务而言,这种策略效果甚微,因为需要不断更新模型所获取的知识。这是一个具有挑战性的研究方向,需要高效且优化的在线学习机制来在边缘端训练深度学习模型[165]。具体而言,目前迫切需要成熟的软件框架,以实现跨不同远程环境本地学习的深度学习模型的联合,同时不损害受保护数据。这种联邦学习场景非常契合安全自动驾驶,在此场景中,车辆之间可通过共享模型信息而非实际采集的数据来丰富模型。由于该研究领域尚处于初期阶段,社区应进一步关注如何将现有框架已取得的初步成果外推至汽车领域,并重点关注延迟、联合模型的可靠性/声誉以及模型过时等关键实施问题[166]。
h) 隐私感知的知识共享
在安全性方面,人类是最后需要承担风险的资产。因此,业界应协同致力于构建更精确的模型。然而,车辆状况和环境的巨大变异性使得构建能够在多样化环境场景中保持其性能水平的深度学习模型变得复杂。在此背景下,亟需使用能够尽可能代表实际安全关键情况的多样化数据集来训练模型。然而,抛开技术因素不谈,尽管最终目标是提升安全性,但在竞争市场中,由于利益相关者不愿分享从其客户组合中获取的数据,这一解决方案的实施变得十分复杂。鉴于此,研究重点应转向联邦学习[167]——一种以深度学习为核心的新型分布式计算范式,通过该范式,部署在车辆上的本地训练模型可以共享其知识(体现为将调整后的参数发送至中央服务器),并利用这些知识在本地提升自身性能[175]。有趣的是,这种分布式计算不会损害本地模型训练数据的隐私。我们预见联邦深度学习在车辆感知领域将具有令人期待的应用前景,使制造商能够在无需过分担心其数据集的隐私和机密性的情况下,实现前所未有的车辆感知水平。
i) 万物互联以提高安全性
在未来智慧城市中,[169],与道路相关的不同实体(如车辆、指示牌、交通信号灯等)将相互连接,以共享有用信息[170],[171]。当然,这些实体需要具备互操作性,因此需要针对自动驾驶汽车研究一系列多样的通信标准,以避免出现互操作性问题[172],[173]。这将使自动驾驶汽车能够获取有关交通拥堵、实时最佳路线建议以及潜在碰撞的必要信息,从而提升自动驾驶安全性。
j) 风险评估
自动驾驶的目标之一是减少道路死亡事故并消除道路上的人为错误。然而,由于现实世界中的不确定性普遍存在,自动驾驶汽车并非完全无风险。因此,风险评估对于提高自动驾驶安全性至关重要。大量文献聚焦于自动驾驶的各个方面,包括路径规划、运动规划、场景分割与理解、基于深度学习的解决方案以及行人对完全自动驾驶汽车的接受度,以降低真实环境中的自动驾驶风险。例如,Cunneen等[174]研究了自动驾驶技术的伦理框架以降低风险。此外,自动驾驶面临的挑战在于自动驾驶汽车如何感知外部环境,以理解不同情境并最小化自动驾驶的整体风险。Hillel等[175]开展的一项关于道路与车道检测的调查显示,自动驾驶汽车的路径规划包含两种策略:1)边界框检测,最大化在框内检测到物体的可能性;2)语义分割,通过分类输入帧中的每个像素实现。然而,在这两种情况下,神经网络的性能在自动驾驶汽车中均表现出显著成功,能够高效地分割车道,使车辆沿道路行驶至最终目的地。此外,当自动驾驶汽车在全新环境中自主驾驶时,存在较高的风险概率。为了在此类环境中最小化自动驾驶的风险,已有研究提出新的大规模数据集[176]用于场景理解的基准测试。例如,SYNTHIA数据集[177]包含用于场景理解的图像,以及[178]用于自动驾驶汽车实时场景分割的算法,以降低自动驾驶中的风险。此外,Johnson-Roberson等[179]收集了超过20万张电脑游戏“Grand Theft Auto V”的图像,用于自动驾驶汽车的车辆检测和速度优化,以降低真实环境中的风险。实验结果表明,在训练过程中使用虚拟环境图像显著降低了自动驾驶汽车在真实世界环境中的风险。
尽管深度学习在自动驾驶汽车领域取得了显著成就,但基于深度学习的感知系统的一个主要局限在于对不确定性的反馈不足。Cunneen et al.[180]回顾了基于人工智能的决策所面临的挑战,其风险以及社会效益。贝叶斯深度学习是连接深度学习与贝叶斯概率的桥梁,能够在深度学习中提供有原则的风险分析。此外,可以通过多次以不同的丢弃权重将输入数据循环通过网络,利用蒙特卡洛丢弃采样来测量模型的不确定性评估。此外,正如 McAllister et al.[181]所建议的,使用贝叶斯网络来估计和传播风险评估将使自动驾驶汽车能够应对不确定性。未来几年应进一步研究其他与风险评估相关的技术,以解决这一问题。
自动驾驶的另一个风险因素是自动驾驶汽车本身,因为它涉及一些复杂的任务,需要同时执行多个电机操作和认知行为,有时这些操作还会快速连续进行。此外,自动驾驶汽车的性能在很大程度上依赖于多变的天气、光照条件以及道路表面状况。同时,行人行为也是一个关键因素,会给车辆的决策环境带来额外的不确定性[182]。由于这些挑战,在发生任何问题时,其造成的成本将非常高。为了确保自动驾驶汽车在公共环境中的可靠性,必须在复杂环境和多变条件下行驶数十亿英里。
七、结论
感知、感知和信号处理技术的最新发展显著提升了自动驾驶的成熟度,从而减少了人类驾驶员的努力,并有助于提高自动驾驶的整体安全性。深度学习策略最近解决了与各个领域(尤其是自动驾驶)相关的许多复杂问题,然而现有文献尚未涵盖其在自动驾驶控制过程中的详细研究。本文指出了深度学习方法的关键优势,并综述了为了安全的自动驾驶所采用的最先进的方法,涵盖了这些方法的主要成就和局限性。此外,本综述识别了自动驾驶流程的主要体现形式,即感知、分析和执行(也称为控制过程),并评估了深度学习方法在多个与安全相关的自动驾驶任务中的表现,包括道路、车道、车辆、行人、疲劳检测、碰撞避免以及交通标志检测。最后,本文强调了自动驾驶领域面临的主要挑战和问题,并提出了未来研究建议,以进一步推动安全自动驾驶的发展。
安全自动驾驶研究数十年来一直是智能交通系统领域关注的焦点。深度学习专家一直在不断努力,力求在自动驾驶汽车领域达到足够的成熟度,使车辆能够通过配备这类强大建模方法的传感器实现全面且可靠的环境感知。我们倡导一个新时代的到来,即研究不仅应致力于提升现代深度学习方法的准确性,还应关注其可用性和实用性[183],例如对可解释性的需求、对抗攻击鲁棒性、认知不确定性的评估以及模型的风险表征,或推导出能够降低它们的能耗。除非研究界积极追求这些方向,否则深度学习仍将局限于学术研究和受控试验环境,车辆安全将无法发挥这一人工智能分支的巨大潜力。
更多推荐
所有评论(0)