视频模型的后训练:强化学习方法

majumdar_ani 发布于 2026-07-19 阅读 24

本文全面介绍了视频模型的后训练方法,特别是强化学习(RL)在提升生成质量中的应用。

图像

在这篇文章中,我将讨论视频模型的后训练方法。与 LLMs 类似,出现了一系列新兴方法,旨在改进预训练模型的各个方面:对提示的遵循度、运动质量、视觉一致性、推理速度等。该领域的主要技术与用于 LLMs 的技术类似:使用 (1) 人类反馈(2) 可验证奖励的强化学习。

图像

在高层次上,视频模型的 RL 使用以下目标函数的某种版本:

sup pθ 𝔼_(c∼𝒟c, v∼pθ(·∣c)) [ r(v, c) − β KL(pθ(·∣c) ‖ p_ref(·∣c)) ] [Eq. (1)]

其中 v 是使用上下文 c 生成的视频,p_ref 是参考(例如预训练)视频模型。关于扩散模型 RL 的早期论文(约 2023 年起)专注于从人类反馈中学习。最近,出现了一系列关于使用可验证奖励进行 RL 的工作,特别是用于改进几何一致性。

基于人类反馈的强化学习 (RLHF)

图像

Diffusion-DPO 和 Flow-DPO

扩散模型的早期 RLHF 方法将直接偏好优化(DPO;Rafailov '23)适配到扩散模型。DPO 利用一个众所周知的观察:公式 (1) 可以闭式求解,从而用策略(生成模型)表示奖励,因此无需从人类偏好数据中显式训练奖励函数。将 DPO 适配到扩散模型的关键挑战在于从扩散模型计算似然。Diffusion-DPO (Wallace '23) 使用证据下界推导出可微近似。

论文《Improving Video Generation With Human Feedback》(Liu '25) 利用去噪扩散模型与流匹配之间的联系,提出了 Flow-DPO。他们还开发了奖励加权回归方法(Flow-RWR)和推理时引导方法(Flow-NRG),但发现 Flow-DPO 表现出更优的性能。

Flow-DPO 论文的主要贡献是以数据为中心。他们创建了一个大规模人工标注的偏好数据集,包含 18.2 万个示例,涵盖偏好的多个维度和 12 个视频生成模型。Flow-DPO 使用该数据集进行 DPO,从而在性能上取得了非常强的改进;请参见上方 RL 前后视频生成的定性示例。SkyReels-v2 视频模型也使用 Flow-DPO 来改进运动质量。

用于流匹配的 GRPO

最近,同策略强化学习方法也被应用于图像和视频生成的流匹配模型。Flow-GRPO (Liu '25) 使用组相对策略优化(GRPO;Shao '24)。将 GRPO 适配到流匹配的关键挑战在于流匹配所遵循的“动作”(即速度)的确定性性质。这限制了探索(这对 RL 至关重要),同时也阻止了公式 (1) 中 KL 散度正则化的计算。为了克服这些挑战,Flow-GRPO 将流匹配用于采样的常微分方程 (ODE) 转化为随机微分方程,同时保持 ODE 所访问状态的边际分布匹配。Flow-GRPO 还减少了训练期间的去噪步数(同时保持推理步数较高)以提高计算效率。

Dance-GRPO (Xue '25) 与 Flow-GRPO 同时发布,并具有许多相同的思路。他们展示了 GRPO 在改善视频模型质量方面的优势;下面是一个示例。

图像

用于 RL 的奖励模型

强大的奖励模型对于 RL 至关重要。除了基于 CLIP 的奖励函数外,视频模型的 RL 还使用在偏好数据上微调的 VLM(例如使用 Bradley-Terry 损失)来进行。例如,RewardDance (Wu '25) 微调一个 VLM,使其接收图像或视频对,并判断其中一个输入在特定轴(例如视觉一致性或文本到图像对齐)上是否优于另一个。分数就是 VLM 对“是”的 token 概率。他们发现,在训练数据中包含推理轨迹可以提高性能。VideoReward (Liu '25) 是另一个基于 VLM 的奖励模型,可在多个质量轴上做出判断。

基于可验证奖励的强化学习 (RLVR)

与 LLMs 相比,关于视频模型 RLVR 的文献仍然非常稀少。即使是“可验证性”的概念也尚未完全明确。在这里,我将讨论使用客观意义上的可验证奖励(即不基于人类偏好)来后训练视频模型的方法,例如跨视频帧的几何一致性或相机运动的平滑性。

Epipolar-DPO

Epipolar-DPO (Kupyn '25) 对视频帧对使用简单的极线几何检查:给定一帧中的点 x 和另一帧中的对应点 x',它们是否满足极线约束 (x')^T F x = 0,其中 F 是关联这两帧的基础矩阵?一旦估计出基础矩阵,偏离该约束的程度可以通过 Sampson 极线误差 (Sampson '82) 来捕捉。Epipolar-DPO 整理了一个离线视频对数据集,该数据集使用极线误差计算的偏好进行标注。然后,该数据集用于使用上面强调的 Diffusion-DPO 或 Flow-DPO 方法对基础模型进行后训练。

VideoGPA

Epipolar-DPO 使用帧对来估计几何一致性,并且仅尝试施加极线约束。相比之下,VideoGPA (Du '26) 尝试施加场景级别的几何一致性。它使用几何基础模型提取相机位姿和点云,这些点云跨帧聚合;然后将聚合后的点云重投影回每一帧,以测量与原始帧的一致性。与 Epipolar-DPO 类似,VideoGPA 构建了一个用于 DPO 的偏好数据集。

图像

VGGRPO

VGGRPO (An '26) 解决了 VideoGPA 的两个挑战:(1) 场景是静态的假设,以及 (2) 需要将视频潜在变量解码为 RGB 图像以计算奖励。对于第一个挑战,VGGRPO 利用了适用于动态场景的几何基础模型。与 VideoGPA 类似,他们计算从所有视频帧聚合的场景点云,然后将其重投影回原始帧;然而,只有场景的静态部分被聚合到点云中。VGGRPO 的第二个创新是训练一个轻量级适配器,将视频潜在变量映射到给定几何基础模型的潜在特征。这意味着 RL 训练(使用 GRPO)可以直接在视频潜在空间中执行。上方的视频定性地展示了 VGGRPO 在一致性方面的改进。

总结思考

到目前为止,视频模型的 RL 方法主要是用于 LLMs 的方法(DPO、PPO、GRPO 等)的适配。看看这种情况是否会继续,或者是否会开发出全新的方法,将会很有趣。特别是 RLVR 是一个非常初期的领域,我预计这里将会有很多活动。对于 LLMs,后训练对于消除预训练模型表现出的不良行为至关重要。虽然 RL 后训练目前对视频模型的作用要有限得多,但我怀疑这种情况在未来几年将会改变。

  • 原文链接: x.com/Majumdar_Ani/statu...
  • 登链社区 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~

相关文章

0 条评论