深度专题
主线讲基础,专题讲进阶争议。每篇围绕一个工程问题,把不同方案的做法和论文证据放在一起:一致的合并理解,前提不同的拆开解释,真正有冲突的保留张力。
6 篇专题
端到端系统如何组织
一段式与两段式,真正的分界线在哪里?
行业讨论里,“一段式”“两段式”“端到端”“OneModel”“有辅助任务”经常被混在一起。真正有用的分法不是数网络有几个,而是检查三件事:规划器必须经过什么信息接口,规划损失能回传到哪里,出了问题团队能定位到哪一层。
规划器:端到端怎样生成一条可执行轨迹
当感知、导航与自车状态已经被编码,端到端规划器究竟怎样用 Query、AR、Diffusion 或 Flow Matching 产生轨迹,并在实时预算内选出最后一条?
“一段式”说的是训练和信息流的边界,不等于从像素直接吐出方向盘转角。量产链路里通常仍有场景编码、条件化的轨迹生成、轨迹过滤与打分、时空优化和控制。本专题把 Query、AR、Diffusion、Flow 放进同一个框架里比较:输入、表示、训练、推理、选轨,重点看它们各自把困难放在了哪里。
从模仿学习到强化学习:训练闭环怎样补上驾驶因果
为什么端到端规划器不能只靠模仿学习,强化学习又为什么取代不了监督底座?PPO、GRPO、奖励、信用分配和闭环 rollout,在量产链路里各自解决什么?
模仿学习负责把真实驾驶数据压成一个能开、像人、训得稳的初始策略;强化学习负责在环境反馈里比较不同行为的后果,优化规则、交互和长时收益。两者不是“旧方法升级成新方法”,而是分工不同。真正难的不在选 PPO 还是 GRPO,而在四件事:闭环环境可不可信,奖励会不会被钻空子,长期后果能不能归因,策略偏离人类分布之后谁把它拉回来。
评测不只是一个分数
开环、闭环和道路验收各自能证明什么,怎样避免被漂亮指标误导?
自动驾驶评测的第一原则,不是挑一个最权威的榜单,而是先问三件事:自车真的动了吗?其他交通参与者会回应吗?传感器观测会随自车的动作更新吗?只有把交互层级、指标口径和场景覆盖拆开,ADE/FDE、PDMS、CARLA 驾驶分这些数字,才能成为能力的证据,而不只是排行榜上的装饰。
从论文方法到车上功能
一篇方法论文要跨过哪些系统门槛,才有资格变成持续可交付的量产能力?
论文证明的是,一种方法在受控的数据和指标上有效;量产要求的是,它在固定算力、异步传感器、带噪声的导航、长尾交通和持续的版本迭代里,仍然安全可控。所以上车不是把模型导出到车端,而是让方法依次过六道门:实时性、训练与数据成本、输入退化、场景专项、规则护栏、持续验收。
量产里常见的坑
端到端从论文走到车上,最常在哪些地方翻车?每个坑该去哪里细读?
这一页是索引,不是新的一章。主线八章和前五篇专题里讲过的量产坑,按类别收在这里,每条只写现象和原因,细节点链接回原处读。另补了几条站内还没讲过的实证,以及功能安全、ODD、软件升级和数据合规这些标准与法规层面的要求。按类别跳着查就行。