摘要由 AI 生成
研究团队提出 Consensus Group Relative Policy Optimization(C-GRPO)方法,将最小 Bayes 风险(MBR)解码技术从推理阶段前移至训练阶段。该方法仅需效用函数与策略样本即可构建组相对目标函数,替代传统依赖金标准参考或偏好数据的优化模式。实验表明,在 WMT 2024 机器翻译和 XSum 文本摘要任务中,C-GRPO 实现了与 MBR 解码相当的性能表现,同时消除了推理时的计算开销,且优于无参考基线方法。
关键实体KEY ENTITIES
C-GRPOGRPOMBR
事件框架EVENT FRAME
产品发布
arXiv:2602.03102v2
C-GRPO
提出无需金标的新文本生成优化算法
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
提出 Consensus Group Relative Policy Optimization(C-GRPO)方法,将最小 Bayes 风险(MBR)解码蒸馏至训练阶段,仅需效用函数与策略样本即可实现文本生成。该方法通过构建组相对目标函数替代传统依赖金标准参考或偏好数据的推理优化模式,在 WMT 2024 机器翻译和 XSum 文本摘要实验中,实现了与 MBR 解码相当的性能且消除了推理时的计算开销,同时优于无参考基线方法。