摘要由 AI 生成
2026 年 9 月 7 日,arXiv cs.CL 领域发布 ConsensusBench,旨在通过结果奖励稠密化技术评估大语言模型的推理共识节点。针对现有强化学习算法因仅依赖最终答案而导致奖励稀疏的问题,该研究提出基于规则的过程级信号 ConsensusPR。该方法从 N 次采样中筛选正确轨迹,并聚类语义等价的中间陈述以识别共识节点,将其整合进类似 GRPO 的算法框架中。ConsensusBench 引入了最终答案准确率、节点覆盖率和每节点 Token 数三项评估指标。实验表明,在 AIME 2024、AIME 2025、GSM8K、MATH-500 及 ConsensusBench 数据集上,该方法在长推理轨迹中显著优于现有的 GRPO 风格方法。
关键实体KEY ENTITIES
ConsensusBenchGRPO
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
ConsensusBench 发布,旨在通过结果奖励稠密化评估大语言模型推理共识节点。该研究针对现有强化学习算法仅依赖最终答案导致奖励稀疏的问题,提出基于规则的过程级信号 ConsensusPR。该方法从 N 次采样中筛选正确轨迹并聚类语义等价中间陈述以识别共识节点,将其整合进 GRPO 风格算法中。ConsensusBench 引入最终答案准确率、节点覆盖率和每节点 Token 数三项指标,并在 AIME 2024、AIME 2025、GSM8K、MATH-500 及 ConsensusBench 数据集上的实验表明,该方法在长推理轨迹中显著优于现有 GRPO 风格方法。