← 论文拆解

DiffusionDriveV2:强化学习约束的截断扩散建模

DiffusionDriveV2: RL-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving

锚内提质,锚间协调

arXiv 2512.07745 ↗

它要解决什么问题

截断扩散保留了多模态,但模仿学习只监督最接近真值的正模式,其他 anchor 下的候选可能低质量甚至碰撞。

机制拆解

  1. 继承 truncated diffusion 生成器
  2. intra-anchor GRPO:只在同一驾驶意图(锚点)内部比较,防止模式坍缩
  3. inter-anchor 截断 GRPO:引入全局视角,避免在一组差候选里「矮子里拔将军」;碰撞这类失败按绝对标准惩罚
  4. 通过探索设计防止生成分布坍缩

量产判断

读完应该能问

  • 各个 anchor 下候选的最差表现是什么?我们测过吗?

回到术语

  • 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
  • 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 的粒度天然对齐到每个 token,但长期 reward 仍可能错归到早期动作;Diffusion 要摊回多个去噪步。