智迹闻AuraTracer
EN

EVENT DOSSIER

“在单策略蒸馏中什么重要?关于数据效率和数据选择的视角”

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

研究人员提出一种基于数据选择的上策蒸馏(OPD)方法,旨在提升大语言模型的训练效率。该方法仅利用 8 个困难样本,即可使参数量在 1.5B 至 7B 之间的学生模型达到 17K 数据集的基线性能水平。研究分析表明,该策略的有效性并非由高 token 熵驱动,而是源于困难样本能自然生成更长的思维链(CoT)路径。这些长 CoT 路径有助于学生在长期推理过程中保持与教师的对齐,并学习反思等关键思维模式。实验验证显示,该方法甚至能够利用完全超出教师模型能力的“无解”样本进行训练,且在一-shot 设置下对所有采样样本均有效。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

What Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data Selection

本文提出一种基于数据选择的上策蒸馏(OPD)方法,仅使用 8 个困难样本即可使 1.5B 至 7B 参数量学生模型达到 17K 数据集基线的性能。研究首先发现 1-shot OPD 在所有采样样本上均有效,且困难样本能带来更优的性能提升;其次分析表明,学生模型的改进并非由高 token 熵驱动,而是由困难问题自然生成的更长思维链(CoT)路径驱动。长 CoT 有助于在长期推理中保持与教师的对齐并学习反思等关键思维模式。基于此,该方法仅选择困难样本进行训练,甚至能利用完全超出教师能力的“无解”样本。实验验证了该数据选择策略的有效性。