1 背景

        传统自动驾驶系统将任务拆解为感知、预测、规划等独立模块(即“P3任务”),导致误差累积(如感知错误传导至规划失效)和规则泛化性差,难以应对长尾场景(如极端天气、突发障碍).并且现有端到端模型虽整合了任务,但存在三大缺陷:

  • 决策短视:仅响应即时输入,缺乏长期推理;

  • 被动感知:无法主动探查环境不确定性(如模糊路标);

  • 高延迟:大模型计算开销难以满足实时控制需求。

        本篇博客主要介绍论文《A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving》,结合其技术架构、核心创新点及行业影响进行系统性阐述。

        近期博客介绍的论文在范式或者思路上,已经没有太多创新或者有意思的点了,所以笔者不再放入专栏当中。

 2 PLA架构

        论文代表了自动驾驶领域从模块化范式向端到端认知智能演进的突破,其核心是通过统一感知-语言-行动(Perception-Language-Action, PLA)框架实现类人的自适应决策能力。

        其框架如下图所示:

2.1 多模态感知编码器(Perception Encoder)

  • 异构传感器融合:整合摄像头、激光雷达、毫米波雷达数据,通过双分支视觉编码器处理:

    • 几何分支:提取3D空间结构与运动特征(车辆距离、道路曲率);

    • 语义分支:对齐图像与文本,识别交通标志、手势等语义实体。

  • 动态特征压缩:采用稀疏卷积与Token剪枝技术,将高维数据压缩至低维向量,减少后续计算负载。

2.2 语言增强的认知引擎(Language-augmented Cognitive Engine)

        引入混合思维推理(Hybrid-Thinking),动态选择推理路径以平衡效率与深度:

推理模式触发条件技术实现
文本链式思考(Text CoT)信息充足的简单场景直接生成驾驶决策(如“绿灯直行”)。
工具链式思考(Tool CoT)不确定性场景(雨雾/夜间)调用外部工具主动感知:
高分辨率视图:放大模糊路标;
RoI检查:聚焦关键区域;
3D检测:识别突发障碍物。
  • 常识知识注入:预训练语言模型(GPT4.1)提供交通规则、文化差异等先验(如“让行”行为的区域差异)。

2.3 分层决策输出(Hierarchical Action Decoder)

  • 元动作规划层:输出高层语义指令(如“减速避让行人”),由语言模型生成可解释决策链;

  • 复杂场景分析:针对复杂场景,可输出场景分析等解释性语言。


实验性能与对比

        评估基准与指标

  • 数据集:nuScenes(闭环规划)。

  • 驾驶指标:L2轨迹误差、碰撞率、极端场景通过率;语言指标:指令遵循精度、解释可读性。

参考文献:《A Unified Perception-Language-Action Framework for Adaptive Autonomous Driving》

更多推荐