智迹闻AuraTracer
EN

EVENT DOSSIER

文本生成的共识组相对策略优化方法

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

研究团队提出 Consensus Group Relative Policy Optimization(C-GRPO)方法,将最小 Bayes 风险(MBR)解码技术从推理阶段前移至训练阶段。该方法仅需效用函数与策略样本即可构建组相对目标函数,替代传统依赖金标准参考或偏好数据的优化模式。实验表明,在 WMT 2024 机器翻译和 XSum 文本摘要任务中,C-GRPO 实现了与 MBR 解码相当的性能表现,同时消除了推理时的计算开销,且优于无参考基线方法。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
C-GRPOGRPOMBR

事件框架EVENT FRAME

产品发布

arXiv:2602.03102v2 C-GRPO 提出无需金标的新文本生成优化算法

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
C-GRPO × GRPO1C-GRPO × MBR1GRPO × MBR1

信号强度SIGNALS

关键词热度
  • C-GRPO1
  • MBR1
  • GRPO1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Consensus Group Relative Policy Optimization for Text Generation

提出 Consensus Group Relative Policy Optimization(C-GRPO)方法,将最小 Bayes 风险(MBR)解码蒸馏至训练阶段,仅需效用函数与策略样本即可实现文本生成。该方法通过构建组相对目标函数替代传统依赖金标准参考或偏好数据的推理优化模式,在 WMT 2024 机器翻译和 XSum 文本摘要实验中,实现了与 MBR 解码相当的性能且消除了推理时的计算开销,同时优于无参考基线方法。