← 术语图鉴

MDP 与 POMDP

Markov Decision Process / Partially Observable MDP · 也叫 马尔可夫决策过程 / 部分可观测马尔可夫决策过程

MDP 假设状态完全可测;POMDP 承认意图这类状态只能从观测里推,策略变成「置信 → 动作」——更贴近驾驶,但在真实规模上只能近似求解。

会上可能听到:“这块决策我们按 POMDP 建模。——车上跑的是精确解,还是哪种近似?”

它到底是什么意思

MDP 求折扣累积奖励的期望最大:γ 管看多远,noise 管动作有多靠不住。它假设状态完全可测,驾驶里这条不成立:切入车的位置和速度测得到,它「打算」切入还是缩回去,测不到。

放松这一条就是 POMDP:手里只有置信,也就是对真实状态的概率分布。老虎问题每听一次花 1 分,说的是获取信息有代价;「低速探出」就像驾驶版的听一次。

难在求解:哪怕只有两个状态,置信也可以是 0 到 1 之间的任意值,没法逐个置信去算价值;到真实驾驶的规模,只能近似。有一种近似是把最可能的状态当真、按 MDP 规划:计算高效,但不会主动收集信息,不确定性高时容易失败。

机制图解

切入车会不会真的切进来

MDP当作测得到 · 策略:状态 → 动作
POMDP意图测不到,只有置信 · 策略:置信 → 动作 · 多看一帧,要付时间和路权
位置和速度测得到,意图测不到——驾驶决策面对的是右边。难处在求解,工程上只能砍。

容易搞混的地方

常见误解

把预测给出的最可能意图当真,就算处理了不确定性

正确理解

那是按最可能的状态规划:不会主动收集信息,不确定性高时容易失败

常见误解

看得越清楚越好,没看清就不动

正确理解

获取信息有代价:驾驶里多等一帧,付的是时间和路权

看懂之后可以追问

  1. 我们是把预测给的最可能意图直接当真,还是保留了意图的概率分布?前者不会主动试探。切入车意图不明的时候,正是这类做法容易失败的时候。
  2. 「再等一帧看清楚」的代价,在我们的决策里是怎么算的?决策要在「多看」和「动手」之间权衡。这一项算轻了,车倾向多观望;算重了,车会在没看清时就动手。

先知道

  • 奖励函数——把安全、效率、舒适、法规、人类偏好折算成一个可优化的数值信号,并用 KL 约束拴住策略别跑偏。
  • 意图预测——先把「对方想去哪」离散成几个候选:哪条车道、哪个出口,再给每个候选打分;轨迹等意图定了再补。

接着看

  • MPDM 与 EPSILON——预定义一小撮语义策略,对每个候选做闭环前向仿真、打分选优——把不可解的 POMDP 砍成「在有限集合里挑一个」。
  • CVaR:尾部风险——期望值会拿大概率的顺畅稀释小概率的灾难;CVaR 放大最坏那部分尾巴的安全代价,α 决定尾巴取多宽,是风险容忍度的旋钮。