通过样本引导的分布匹配实现视频生成的联合对齐与蒸馏
提出一种基于样本引导分布匹配的统一单阶段优化框架,以解决视频生成中强化学习计算开销大及模型坍塌问题。该方法引入 DM-Align,利用 DPO 和 GRPO 思想从偏好对或组内探索构建分布差距,直接构造指向人类偏好样本的梯度方向。通过协同真实与虚假模型的梯度及偏好引导梯度,消除传统强化学习中多步奖励评估及复杂 ODE-SDE 转换需求。跨多个基础视频模型的综合实验表明,该框架在蒸馏质量和偏好对齐方面均优于独立变体及两阶段流水线方案。
EVENT DOSSIER
2026 年 9 月 7 日,arXiv cs.CV 发布论文《Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching》,提出一种基于样本引导分布匹配(DM-Align)的统一单阶段优化框架。该研究旨在解决视频生成中强化学习计算开销大及模型坍塌问题。方法利用 DPO 和 GRPO 思想,从偏好对或组内探索构建分布差距,直接构造指向人类偏好样本的梯度方向。通过协同真实与虚假模型的梯度及偏好引导梯度,消除了传统强化学习中多步奖励评估及复杂 ODE-SDE 转换需求。跨多个基础视频模型的综合实验表明,该框架在蒸馏质量和偏好对齐方面均优于独立变体及两阶段流水线方案。
DM-Align 提出视频生成统一优化框架
提出一种基于样本引导分布匹配的统一单阶段优化框架,以解决视频生成中强化学习计算开销大及模型坍塌问题。该方法引入 DM-Align,利用 DPO 和 GRPO 思想从偏好对或组内探索构建分布差距,直接构造指向人类偏好样本的梯度方向。通过协同真实与虚假模型的梯度及偏好引导梯度,消除传统强化学习中多步奖励评估及复杂 ODE-SDE 转换需求。跨多个基础视频模型的综合实验表明,该框架在蒸馏质量和偏好对齐方面均优于独立变体及两阶段流水线方案。