智迹闻AuraTracer
EN

EVENT DOSSIER

Sequential Beats Joint:关于在线策略蒸馏与 RLVR 之间的相互作用

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv cs.AI 发布论文《Sequential Beats Joint》,提出一种两阶段模型训练方法:先进行基于策略蒸馏(OPD),再进行强化学习(RL)。实验表明,该'OPD-then-RL'方案在逻辑与数学推理基准上持续优于纯 OPD、纯 RLVR 及所有现有联合基线。研究通过行为分析发现,OPD 扩展了学生对教师支持解的覆盖范围,而 RL 在此范围内进行精细优化;若同时优化两种信号则会导致相互干扰。此外,实验确认 OPD 验证分数是切换至 RL 的关键信号,且 OPD 比监督微调(SFT)更适合作为 RL 的冷启动。该研究确立了将两种纠缠的训练信号转化为互补阶段的有效路径。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

本文提出一种两阶段训练方案,即先进行基于策略蒸馏(OPD)再进行强化学习(RL),该方案在逻辑与数学推理基准上持续优于纯 OPD、纯 RLVR 及所有现有联合基线。研究通过 pass@$k$ 行为、学习动态和参数更新提供了系统性解释:OPD 扩展了学生对教师支持解的覆盖范围,而 RL 在此范围内进行精细优化;联合优化两种信号则导致相互干扰。实验发现,OPD 验证分数是切换至 RL 的关键信号,且 OPD 比监督微调(SFT)更适合作为 RL 的冷启动。这些结果确立了"OPD-then-RL"作为一种简单而强大的方法,将两种纠缠的信号转化为互补的训练阶段。