Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation
arXiv:2604.19234v3 提出 Objective-aware Trajectory Credit Assignment (OTCA) 框架以解决 Group Relative Policy Optimization (GRPO) 在视觉生成中因粗粒度奖励信用分配导致的优化信号失配问题。该框架包含轨迹级信用分解和多目标信用分配两个组件,通过联合建模时序与目标级信用,将单一静态标量奖励转化为结构化的、时间步感知的训练信号。实验表明,OTCA 在图像和视频生成的各项评估指标上均能一致性地提升生成质量。