摘要由 AI 生成
2026 年 9 月 8 日,Hugging Face Papers 发布 FlowBalance 论文。该研究提出了一种新的强化学习范式,旨在通过利用策略内(on-policy)的推理经验来实现模型的自我改进。FlowBalance 的核心机制是引入验证器(Verifier),使模型能够基于自身的推理过程进行自我评估与修正,从而在无需额外数据或离线训练的情况下提升性能。该方法将验证器的 grounding 能力与策略网络的在线更新相结合,为强化学习中的自我监督提供了新路径。
关键实体KEY ENTITIES
FlowBalanceHaitao MiKishan PanagantiLeowei LiangZixun Huang
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- FlowBalance1
- Zixun Huang1
- Kishan Panaganti1
- Haitao Mi1
- Leowei Liang1
全部报道(1)SOURCES
↗
Hugging Face 研究员 Kishan Panaganti 等人提出 FlowBalance,这是一种基于验证器(Verifier)的自改进方法,旨在解决推理模型在 On-Policy Self-Improvement (OPSD) 中因特权反馈强化错误轨迹而导致的失败模式。该方法结合稀疏结果奖励与密集自我反馈,通过冻结训练时视图生成 token 级概率增益并聚合为轨迹级引导分数,利用验证器导出的组优势校准该分数:在正优势轨迹保留引导、负优势轨迹反转引导、无结果偏好时禁用引导。最终通过指数重加权参考策略及轨迹平衡拟合归一化目标,实现无需单独 token 级模仿损失的结果校准自引导。分析表明其具备组内对比保持、最小变化逆 KL 刻画等特性,并在数学推理任务上相比 FlowRL 在 Qwen3-4B 和 …