← 术语图鉴

CVaR:尾部风险

Conditional Value at Risk · 也叫 条件风险价值

期望值会拿大概率的顺畅稀释小概率的灾难;CVaR 放大最坏那部分尾巴的安全代价,α 决定尾巴取多宽,是风险容忍度的旋钮。

会上可能听到:“这个策略在仿真里平均分最高。——最坏的那些分支长什么样?”

它到底是什么意思

危险轨迹概率 p、惩罚 r,对期望只贡献 −p·r:惩罚远小于 1/p,学习器看不见它;远大于 1/p,方差又大到没法稳定估计。只调奖励的数值,治不了本。

设想一个汇入口:「直接汇入」在 90% 的分支里顺畅、10% 的分支里撞上记 −100,期望把灾难稀释得看起来「还行」。CVaR 不再平等地看所有分支,而是放大最坏那部分尾巴的安全代价;α 越大尾巴越窄,取到 0.9 以上,盯住的就是那 10% 的碰撞。

MARC 把它和场景树一起用。消融实验放在一个加塞场景里:自车只保持车道、旁车强行切入,每种做法随机初始化跑 100 次。动态分支再加上风险感知,成功率从 96% 升到 100%,平均最大减速度从 1.63 降到 1.14 m/s²。

机制图解

「直接汇入」:90% 顺畅,10% 撞上记 −100

看期望0.9 × 收益 + 0.1 × (−100) · 灾难被平均稀释,看起来「还行」
看 CVaR,α 取 0.9 以上只看最坏那 10% · 盯住的就是碰撞本身
α 是风险容忍度的旋钮:α 越大尾巴越窄,越盯着最坏的分支。它把「保守还是激进」写成了一个数。

容易搞混的地方

常见误解

碰撞惩罚调得足够大,期望就能管住尾部

正确理解

惩罚远小于 1/p 会被忽略,远大于 1/p 方差失控,只调奖励的数值治不了本。CVaR 用在规划这一侧:分支和概率已经摆出来,它放大最坏那部分的安全代价

常见误解

CVaR 就是只看最坏的那一个分支

正确理解

它看的是最坏那部分尾巴,尾巴取多宽由 α 决定:α 越大尾巴越窄

看懂之后可以追问

  1. 评审时我们看的是期望分数,还是最坏那部分分支的表现?期望会拿大概率的顺畅稀释小概率的碰撞。只报平均分,那次碰撞在会上看不见。
  2. 风险容忍度 α 取多少?依据是什么?α 把「保守还是激进」写成了一个数。说不出依据,风险偏好就只是调参时顺手定的。

先知道

  • MPDM 与 EPSILON——预定义一小撮语义策略,对每个候选做闭环前向仿真、打分选优——把不可解的 POMDP 砍成「在有限集合里挑一个」。

对比着看

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。

接着看

  • 边际预测与联合预测——边际预测给每辆车各自一组带概率的轨迹;联合预测把概率标在整个场景上,同一场景里各车的轨迹互相配套。