摘要由 AI 生成
针对大型语言模型后训练中依赖海量 Token 密集监督的传统假设,研究团队在基于 Qwen3 家族的 on-policy distillation (OPD) 设置中发现,极小比例的生成 Token(每推理轨迹仅一两个,占总量的 0.05%)即可有效激励模型的推理能力。实验表明,该稀疏监督方案在多数情况下匹配甚至超越全 Token 训练的效果。这一现象在九个不同模型规模的教师 - 学生配置中均被观察到,并在数学推理任务、编码推理以及基于可验证奖励 (RLVR) 的强化学习中得到进一步验证。研究结果挑战了后训练必须依赖 Token 密集的传统观点,提示极稀疏监督可能更接近自然的学习过程。
关键实体KEY ENTITIES
Llama modelsProximal Policy OptimizationQwen3 family
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Qwen3 family1
- Llama models1
- Proximal Policy Optimization1
全部报道(1)SOURCES
↗
大型语言模型通过有效后训练展现出日益增强的推理能力,但现有方法优化海量 Token 并隐含假设学习必须依赖 Token 密集。研究团队在基于 Qwen3 家族的 on-policy distillation (OPD) 设置中,发现极小比例的生成 Token(每推理轨迹仅一两个,占总量 0.05%)即可有效激励推理能力,该稀疏监督在多数情况下匹配或超越全 Token 训练效果。这一现象在九个不同模型规模的教师 - 学生配置及数学推理任务上一致观察到,并在编码推理、Llama 模型及基于可验证奖励 (RLVR) 的强化学习中得到进一步验证。研究挑战了后训练必须依赖 Token 密集的传统假设,并指出极稀疏监督可能更接近自然学习过程。