← 术语图鉴

两段式

Two-stage End-to-End

第一段输出结构化世界(目标、车道线、交通灯),第二段基于它生成轨迹——用信息压缩换可解释和可控。

会上可能听到:“第一段出感知结果,第二段做规划。——这算端到端吗?为什么很多团队转端到端时先做这个?”

它到底是什么意思

第一段的输出是人能看懂的:3D 目标框、速度、tracking ID、车道线 polyline、交通灯颜色和路口通行性,以及他车的多模态预测轨迹与概率。第二段的规划器只读这些结果。

它的价值全在工程上:能看见中间结果所以能定位问题;能接规则约束和风险检测;感知、预测、规划可以分开升级不必重训全链路;训练更稳定,问题归因更直接。

代价同样清楚:中间表征压缩掉了细粒度几何和交互意图,上下游容易互相甩锅,梯度无法完整跨模块反传,复杂交互场景的性能上限可能低于一段式。

机制图解

传感器输入

第一段:感知3D 框 / 车道线 / 交通灯 / 预测轨迹(人能看懂)
第二段:规划基于结构化输入生成轨迹
第一段的输出是人能看懂的,所以能定位问题、能加规则。代价是这一层压缩掉的信息,第二段再也拿不回来。

容易搞混的地方

常见误解

两段式就是传统 pipeline 换个名字

正确理解

两段的感知和规划模块本身都是可学习的,不是手写规则

常见误解

两段式一定比一段式差

正确理解

它是拿上限换可控性。选哪条是取舍,不是代际,两边都有量产公司

看懂之后可以追问

  1. 中间表征里,我们丢掉了哪些信息?这些信息在哪类场景会变成问题?两段式的天花板就在这个压缩上。让团队具体说出丢了什么,比笼统说「上限低」有用得多,也能提前锁定风险场景。
  2. 感知和规划出问题时,责任怎么划?有没有共同的评测口径?两段式最典型的组织问题是互相甩锅。提前建立联合评测口径,比事后开协调会便宜。

先知道

  • 端到端——让模型更直接地从传感器输入学到驾驶输出,减少中间环节的信息损失,但不等于取消工程约束。

对比着看

  • 一段式——规划器除了结构化结果,还能直读上游的共享特征,规划损失能回传更新表征——上限更高,但难归因、难闭环验证。

接着看

  • 导航路径——两段式方案里由模型预测的一条宏观参考线:只表达该往哪走,不是可执行轨迹,不能直接控车。

相关论文