它要解决什么问题
截断扩散保留了多模态,但模仿学习只监督最接近真值的正模式,其他 anchor 下的候选可能低质量甚至碰撞。
机制拆解
- 继承 truncated diffusion 生成器
- intra-anchor GRPO:只在同一驾驶意图(锚点)内部比较,防止模式坍缩
- inter-anchor 截断 GRPO:引入全局视角,避免在一组差候选里「矮子里拔将军」;碰撞这类失败按绝对标准惩罚
- 通过探索设计防止生成分布坍缩
量产判断
读完应该能问
- 各个 anchor 下候选的最差表现是什么?我们测过吗?
回到术语
- 截断扩散与锚点——不从纯噪声出发,而是从聚类得到的轨迹锚点加少量噪声开始去噪,用少数几步换取车端实时性。
- PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。
- 信用分配——整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 的粒度天然对齐到每个 token,但长期 reward 仍可能错归到早期动作;Diffusion 要摊回多个去噪步。