智迹闻AuraTracer
EN

EVENT DOSSIER

“极度稀疏的监督机制能够激发推理能力”

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

针对大型语言模型后训练中依赖海量 Token 密集监督的传统假设,研究团队在基于 Qwen3 家族的 on-policy distillation (OPD) 设置中发现,极小比例的生成 Token(每推理轨迹仅一两个,占总量的 0.05%)即可有效激励模型的推理能力。实验表明,该稀疏监督方案在多数情况下匹配甚至超越全 Token 训练的效果。这一现象在九个不同模型规模的教师 - 学生配置中均被观察到,并在数学推理任务、编码推理以及基于可验证奖励 (RLVR) 的强化学习中得到进一步验证。研究结果挑战了后训练必须依赖 Token 密集的传统观点,提示极稀疏监督可能更接近自然的学习过程。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Llama modelsProximal Policy OptimizationQwen3 family

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Llama models × Proximal…1Llama models × Qwen3 fa…1Proximal Policy Optimiz…1

信号强度SIGNALS

关键词热度
  • Qwen3 family1
  • Llama models1
  • Proximal Policy Optimization1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Extremely Sparse Supervision Incentivizes Reasoning Ability

大型语言模型通过有效后训练展现出日益增强的推理能力,但现有方法优化海量 Token 并隐含假设学习必须依赖 Token 密集。研究团队在基于 Qwen3 家族的 on-policy distillation (OPD) 设置中,发现极小比例的生成 Token(每推理轨迹仅一两个,占总量 0.05%)即可有效激励推理能力,该稀疏监督在多数情况下匹配或超越全 Token 训练效果。这一现象在九个不同模型规模的教师 - 学生配置及数学推理任务上一致观察到,并在编码推理、Llama 模型及基于可验证奖励 (RLVR) 的强化学习中得到进一步验证。研究挑战了后训练必须依赖 Token 密集的传统假设,并指出极稀疏监督可能更接近自然学习过程。