智迹闻AuraTracer
EN

EVENT DOSSIER

论文页面 - FlowBalance:基于在策略推理经验的自改进验证器模型

2026-09-08 08:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

2026 年 9 月 8 日,Hugging Face Papers 发布 FlowBalance 论文。该研究提出了一种新的强化学习范式,旨在通过利用策略内(on-policy)的推理经验来实现模型的自我改进。FlowBalance 的核心机制是引入验证器(Verifier),使模型能够基于自身的推理过程进行自我评估与修正,从而在无需额外数据或离线训练的情况下提升性能。该方法将验证器的 grounding 能力与策略网络的在线更新相结合,为强化学习中的自我监督提供了新路径。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
FlowBalanceHaitao MiKishan PanagantiLeowei LiangZixun Huang

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
FlowBalance × Haitao Mi1FlowBalance × Kishan Pa…1FlowBalance × Leowei Li…1FlowBalance × Zixun Hua…1Haitao Mi × Kishan Pana…1Haitao Mi × Leowei Liang1

信号强度SIGNALS

关键词热度
  • FlowBalance1
  • Zixun Huang1
  • Kishan Panaganti1
  • Haitao Mi1
  • Leowei Liang1

全部报道(1)SOURCES

H Hugging Face Papers en 2026-09-08 08:00

Paper page - FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

Hugging Face 研究员 Kishan Panaganti 等人提出 FlowBalance,这是一种基于验证器(Verifier)的自改进方法,旨在解决推理模型在 On-Policy Self-Improvement (OPSD) 中因特权反馈强化错误轨迹而导致的失败模式。该方法结合稀疏结果奖励与密集自我反馈,通过冻结训练时视图生成 token 级概率增益并聚合为轨迹级引导分数,利用验证器导出的组优势校准该分数:在正优势轨迹保留引导、负优势轨迹反转引导、无结果偏好时禁用引导。最终通过指数重加权参考策略及轨迹平衡拟合归一化目标,实现无需单独 token 级模仿损失的结果校准自引导。分析表明其具备组内对比保持、最小变化逆 KL 刻画等特性,并在数学推理任务上相比 FlowRL 在 Qwen3-4B 和 …