← 术语图鉴

信用分配

Credit Assignment

整条轨迹拿到一个 reward,要把功过分配回生成过程中的哪一步——AR 的粒度天然对齐到每个 token,但长期 reward 仍可能错归到早期动作;Diffusion 要摊回多个去噪步。

会上可能听到:“Diffusion 接 RL 比 AR 难。——难在哪?”

它到底是什么意思

AR 是一步步生成动作 token,reward 可以较自然地对应到 rollout 的时间步,粒度天生对齐。但 reward 多半仍是整条轨迹给的,十秒后的事故该算到哪一步,照样要倒推。

Diffusion 往往是多步去噪后一次得到整条轨迹,而 reward 通常也是轨迹级别的。梯度要分配回各个去噪步骤和轨迹片段,归因更间接、训练更敏感、容易震荡。

解决思路就是那几种:anchor 分组、目标点约束、value guidance、GRPO 组内比较、ODE 转 SDE 加探索。

机制图解

一条轨迹拿到一个总分,功过算谁的

AR + RL一步一个 token,总分能乘到每个 token 上,粒度和时间步对齐;但哪一步惹的祸仍要倒推
Diffusion + RL整条轨迹一次生成,总分要摊回每个去噪步;去噪步和时间步对不上,归因更间接
生成质量和可优化性是两个维度。只比生成效果做选型,接 RL 时会付额外代价。

容易搞混的地方

常见误解

生成效果好的方案就该选

正确理解

生成质量和可优化性是两个维度,接 RL 的难度要算进选型

常见误解

训练震荡是调参没调好

正确理解

信用分配困难会直接表现为震荡,重跑次数是应该算进排期的隐性成本

看懂之后可以追问

  1. 我们选这条生成路线的时候,把接 RL 的难度算进去了吗?生成质量和可优化性是两个维度。只比生成效果选型,后面接 RL 时会付额外的代价。
  2. RL 微调的训练稳定性怎么样?需要跑几次才能得到一个可用版本?信用分配困难会直接表现为训练震荡。重跑次数是隐性成本,排期时经常被漏算。

先知道

  • 扩散模型轨迹生成——先给真实轨迹逐步加噪,再学习反向去噪——天然适合表达「未来有多个合理答案」,但多步去噪会拖慢推理。
  • 自回归轨迹生成——把轨迹变成 next-token prediction,一步步生成——训练稳定、天然接 RL,但会误差累积、多模态容易坍缩。

接着看

  • PPO 与 GRPO——都是策略优化算法;GRPO 用「同场景多条候选的组内相对好坏」算优势,省掉了单独的价值网络。

相关论文