Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR
本文提出一种两阶段训练方案,即先进行基于策略蒸馏(OPD)再进行强化学习(RL),该方案在逻辑与数学推理基准上持续优于纯 OPD、纯 RLVR 及所有现有联合基线。研究通过 pass@$k$ 行为、学习动态和参数更新提供了系统性解释:OPD 扩展了学生对教师支持解的覆盖范围,而 RL 在此范围内进行精细优化;联合优化两种信号则导致相互干扰。实验发现,OPD 验证分数是切换至 RL 的关键信号,且 OPD 比监督微调(SFT)更适合作为 RL 的冷启动。这些结果确立了"OPD-then-RL"作为一种简单而强大的方法,将两种纠缠的信号转化为互补的训练阶段。