智迹闻AuraTracer
EN

EVENT DOSSIER

ConsensusBench:通过结果奖励富集技术实现LLM推理共识节点的基准测试

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv cs.CL 领域发布 ConsensusBench,旨在通过结果奖励稠密化技术评估大语言模型的推理共识节点。针对现有强化学习算法因仅依赖最终答案而导致奖励稀疏的问题,该研究提出基于规则的过程级信号 ConsensusPR。该方法从 N 次采样中筛选正确轨迹,并聚类语义等价的中间陈述以识别共识节点,将其整合进类似 GRPO 的算法框架中。ConsensusBench 引入了最终答案准确率、节点覆盖率和每节点 Token 数三项评估指标。实验表明,在 AIME 2024、AIME 2025、GSM8K、MATH-500 及 ConsensusBench 数据集上,该方法在长推理轨迹中显著优于现有的 GRPO 风格方法。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
ConsensusBenchGRPO

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
ConsensusBench × GRPO1

信号强度SIGNALS

关键词热度
  • ConsensusBench1
  • GRPO1

全部报道(1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

ConsensusBench: Benchmark of Consensus Nodes for LLM Reasoning via Outcome Reward Densifying

ConsensusBench 发布,旨在通过结果奖励稠密化评估大语言模型推理共识节点。该研究针对现有强化学习算法仅依赖最终答案导致奖励稀疏的问题,提出基于规则的过程级信号 ConsensusPR。该方法从 N 次采样中筛选正确轨迹并聚类语义等价中间陈述以识别共识节点,将其整合进 GRPO 风格算法中。ConsensusBench 引入最终答案准确率、节点覆盖率和每节点 Token 数三项指标,并在 AIME 2024、AIME 2025、GSM8K、MATH-500 及 ConsensusBench 数据集上的实验表明,该方法在长推理轨迹中显著优于现有 GRPO 风格方法。