Reward-Aware Trajectory Shaping for Few-step Visual Generation
arXiv:2604.14910v4 提出 Reward-Aware Trajectory Shaping (RATS) 框架,旨在通过偏好对齐解决少步生成中受限于多步教师的问题。该方法在关键去噪阶段对齐师生潜轨迹,并引入基于相对奖励表现的奖励感知门控机制:当教师奖励更高时强化轨迹塑造,当学生匹配或超越教师时则放松约束以持续优化。RATS 实现了无需额外测试时间计算开销的偏好知识迁移,实验表明其显著提升了少步生成的效率 - 质量权衡,大幅缩小了少步学生与强多步生成器之间的性能差距。