23.9 DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving
Paper · arXiv 2023
DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving
DriveDreamer 把真实道路视频、HD Map、3D boxes、文本和车辆动作接入同一个扩散式世界模型:结构条件负责约束场景,动作负责滚动未来状态,扩散特征同时服务于视频生成和轨迹预测。
作者:Xiaofeng Wang、Zheng Zhu、Guan Huang、Xinze Chen、Jiagang Zhu、Jiwen Lu · GigaAI / Tsinghua University · arXiv v2:2023-11-27 · 阅读:2026-07-27 · 摘要 · PDF · 项目页
1 执行摘要
- 定位:论文试图把此前多在游戏或仿真环境中的 world model 推向真实驾驶数据,并让同一模型同时承担可控视频生成、动作条件未来预测和驾驶轨迹预测。
- 方法:第一阶段训练 Auto-DM,用 HD Map、3D boxes 与文本约束 Stable Diffusion,并通过时序注意力扩展到视频;第二阶段用 ActionFormer 根据历史结构和车辆动作递推未来结构 latent,再交给 Auto-DM 生成未来视频。
- 主要结果:完整两阶段模型在 nuScenes 上达到 FID 14.9、FVD 340.8;加入 4K 合成样本后,BEVFusion mAP 从 32.8 提升到 35.8;开环规划平均 L2 为 0.29 m、碰撞率为 0.15%。
- 最可信结论:结构条件预训练和 ActionFormer 都对论文采用的生成指标有增益,且合成图像能改善两个 3D 检测器,说明模型学到了一定可利用的交通结构信息。
- 边界:生成质量主要只与 DriveGAN 比较;轨迹结果是 nuScenes 开环评估;没有闭环交互、安全干预、跨城市泛化或长时滚动误差。因此“世界模型”在本文中更接近动作条件视频预测器,而非已验证的闭环驾驶环境。
2 背景与问题
论文将自动驾驶 world model 的价值拆成两类:生成多样、逼真的驾驶视频,为感知模型补充长尾训练数据;预测环境未来及驾驶策略,为端到端规划提供表征。作者认为当时的主要缺口是相关研究多依赖游戏、仿真或 BEV 语义空间,尚未充分建模真实道路像素分布。
真实驾驶视频的像素空间巨大且动态复杂。DriveDreamer 的核心取舍是不用纯像素动力学独自搜索,而是显式引入 HD Map、3D boxes、文本和 ego action,把未来预测分解成“结构状态演化 + 条件视频渲染”。
3 方法与机制

原文图 3:HD Map、3D boxes、动作和参考图像共同约束未来结构;Auto-DM 负责视频生成,扩散多尺度特征还进入动作解码器。
3.1 输入、状态与输出
初始观测包括参考图像 I0、HD Map H0、3D boxes B0,并可接收文本描述与一段 ego actions。模型输出未来视频,以及更远期的驾驶动作。HD Map 是与图像空间对齐的条件;3D boxes 通过类别 CLIP embedding、Fourier 位置编码和 MLP 变成位置 token。
3.2 第一阶段:Auto-DM 学交通结构
Auto-DM 基于 Stable Diffusion v1.4。原模型参数冻结,主要训练 gated self-attention、temporal attention 与 cross-attention 等新增模块。空间对齐的 HD Map 编码后与噪声 latent 拼接;3D box token 通过 gated self-attention 注入 UNet;文本通过 cross-attention 控制天气和昼夜风格。
第一阶段有两个步骤:Step 1 用单帧结构条件生成单图,暂不使用 temporal attention;Step 2 加入时序注意力,用连续结构条件监督 32 帧视频。两步均采用标准扩散噪声预测损失,即让网络恢复前向过程加入的噪声(式 4)。
3.3 第二阶段:ActionFormer 滚动未来结构
未来时刻没有真实 HD Map/box 条件,ActionFormer 因此先把 H0 和 B0 编码为隐藏状态,再用 cross-attention 融合动作。随机 latent s_t 由高斯分布参数化,GRU 递推隐藏状态 h_t,最终解码出供 Auto-DM 使用的未来结构特征。
s_t ~ N(mu(F_ca(h_t, A_t)), sigma(F_ca(h_t, A_t)) I)
h_(t+1) = GRU(h_t, s_t)
这种设计把“动作如何改变交通结构”与“结构如何渲染成视频”分开。ActionFormer 在 feature level 预测结构条件,作者认为这比像素级预测更抗噪。
3.4 视频与动作联合预测
第二阶段同时优化未来视频和未来动作的条件似然下界(式 10)。论文省略 latent KL 项,理由是经验上简化目标可得到相似结果,但未给出对应消融。动作头把 Auto-DM 的多尺度 UNet pooled features 与历史动作特征拼接,经 MLP 输出未来轨迹。
4 证据与实验
4.1 数据和训练设置
全部实验基于 nuScenes:700 个训练视频、150 个验证视频,每段约 20 秒、六相机、12 Hz,作者统计约 100 万帧。HD Map 由 devkit 获取;由于 nuScenes 3D box 标注只有 2 Hz,论文用外部流式感知方法补齐到 12 Hz。ego yaw angle 与 velocity 作为动作输入。
单图阶段训练 40 epochs、batch 16;视频阶段训练 10 epochs、batch 1、32 帧、448x256;第二阶段再训练 10 epochs、batch 1,预测 16 帧未来视频和 16 个更远期动作。优化器为 AdamW、学习率 5e-5,硬件为 A800,但 GPU 数量、总训练时长和采样步数未报告。
4.2 视频生成与结构消融

原文图 6、表 1-2:上半部分展示多视角条件生成;下方量化合成数据增广和两阶段训练对 FID/FVD 的影响。
| 模型 | Auto-DM 预训练 | ActionFormer | FID ↓ | FVD ↓ |
|---|---|---|---|---|
| DriveGAN | 否 | 否 | 27.8 | 390.8 |
| DriveDreamer | 否 | 否 | 15.9 | 363.3 |
| DriveDreamer | 是 | 否 | 15.3 | 349.6 |
| DriveDreamer | 是 | 是 | 14.9 | 340.8 |
同一论文设置下,扩散骨干本身相对 DriveGAN 带来最大增益;第一阶段结构训练和 ActionFormer 继续稳定改善 FID/FVD。该消融支持组件对生成分布指标有效,但只有一个外部生成基线,且 FID/FVD 不直接测量动作因果一致性。
4.3 合成数据的下游价值
作者从 nuScenes 训练集抽取 4K 结构条件,生成 768x448 多视图图像并缩放到检测器输入,与真实数据混合训练 12 epochs。FCOS3D mAP/NDS 从 30.2/38.1 提升至 30.9/38.3;BEVFusion 从 32.8/37.6 提升至 35.8/39.5。两个检测器均受益,尤其 BEVFusion 的 mAP +3.0,是本文比纯视觉展示更强的实用证据。
4.4 驾驶动作预测
| 方法 | 视觉 | 动作 | 平均 L2 (m) ↓ | 碰撞率 (%) ↓ |
|---|---|---|---|---|
| ST-P3 | 是 | 否 | 2.11 | 0.71 |
| UniAD | 是 | 否 | 1.65 | 0.31 |
| AD-MLP | 否 | 是 | 0.29 | 0.19 |
| VAD | 是 | 是 | 0.37 | 0.14 |
| DriveDreamer | 是 | 是 | 0.29 | 0.15 |
DriveDreamer 与 action-only 的 AD-MLP 在 L2 上持平,并把碰撞率从 0.19% 降到 0.15%;相对 VAD,L2 更低但碰撞率略高。论文所称“增强安全性”仅由离线碰撞指标支持,不能外推为闭环安全结论。
5 主张与证据边界
| 主张 | 类型 | 证据位置 | 支持强度 | 判断 |
|---|---|---|---|---|
| 两阶段训练提升视频生成质量 | 作者主张 | 表 2 | 中-高 | 组件消融方向一致,但外部基线少 |
| 模型理解了结构交通约束 | 作者主张 | 图 6、表 1-2 | 中 | 视觉对齐和检测增益提供间接证据,缺少专门的条件一致性指标 |
| 可作为感知训练数据生成器 | 支持性推断 | 表 1 | 中-高 | 两个检测器均提升,但只测 4K 样本和 nuScenes 域内训练 |
| 视觉 world-model 特征改善规划 | 作者主张 | 表 3 | 中 | 相对 AD-MLP 碰撞率改善,但缺少相同动作头去除视觉特征的直接消融 |
| 形成可执行、可预测的驾驶世界模型 | 作者主张 | 第 3.2、5 节 | 低-中 | 只验证开环预测,没有闭环执行或干预恢复 |
6 局限与疑问
- 单数据集:训练与验证均在 nuScenes,缺少跨城市、跨传感器、跨天气和跨国家迁移。
- 短时预测:主要预测 16 帧,论文没有系统报告长时滚动后的结构漂移、对象消失或多模态分叉。
- 条件并非部署时天然可得:模型依赖 HD Map 与 3D boxes;训练时 box 还由外部感知方法补齐。真实部署误差如何传导到生成和规划未测。
- 生成评估不充分:FID/FVD 只比较 DriveGAN,且没有对象级 box/road adherence、动作响应正确率或人评协议。
- 开环规划局限:轨迹离线接近 expert 不代表闭环能处理自身动作改变后的分布;论文自己引用了对 nuScenes 开环评估的反思工作,但未增加闭环验证。
- 世界模型定义偏宽:系统包含生成器、结构预测器和动作头,但没有证明 latent transition 可用于规划搜索、反事实评估或 policy improvement。
- 复现信息:论文给出 epoch、batch 和学习率,但未报告 GPU 数、训练时长、采样速度、随机种子或多次重复。
7 阅读地图
- 生成骨干:Latent Diffusion / Stable Diffusion 提供 Auto-DM 基础;ControlNet、GLIGEN 等工作解释结构条件如何注入扩散 UNet。
- 驾驶生成对照:DriveGAN 是本文主要视频基线;BEVControl、MagicDrive、DrivingDiffusion 属于同期结构可控街景生成路线。
- 世界模型对照:MILE、SEM2、ISO-Dream 主要在 BEV 或仿真/控制框架中建模未来,DriveDreamer 的差异是直接生成真实道路像素并联动动作。
- 规划评估:ST-P3、UniAD、AD-MLP、VAD 提供开环轨迹基线;阅读结果时应结合论文引用的《Rethinking the Open-loop Evaluation of End-to-end Autonomous Driving in nuScenes》。
- 后续问题:继续追踪动作条件视频世界模型是否能在闭环仿真中提供可校准的反事实结果,而不只是生成视觉上合理的视频。
8 My Thoughts
- 方法理解:模型采用两阶段方案,利用感知真值或感知模型产生的稀疏结构结果(HD Map、3D boxes)作为条件,学习预测未来结构状态,并进一步生成未来帧图像与未来驾驶轨迹。
- 核心局限:没有看出 world model 究竟如何影响轨迹生成。论文的 world model 主体更像是为未来图像生成服务,轨迹则由历史动作与 Auto-DM 多尺度特征接入额外 MLP 头生成;缺少“去掉 world-model 视觉特征”或“只保留动作输入”的直接消融,因此无法确认世界模型表征对轨迹预测的独立贡献。
9 来源与参考
- DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving,arXiv:2309.09777v2,15 页。
- 论文 PDF。本笔记的框架图和实验图表均从该 PDF 原图截取。
- DriveDreamer 项目页(由 arXiv 摘要页提供)。
更多推荐
所有评论(0)