智迹闻AuraTracer
EN

EVENT DOSSIER

从偏好到原则:基于评分标准的知识答案对齐方法

2026-08-27 08:00 大模型 🔥 28.9 事件热度
1家信源
1天持续发酵
28.9事件热度
0个提及
摘要由 AI 生成

针对开放域问答中难以用单一标量衡量高质量回答的挑战,Apple ML Research 团队引入了一种基于评分表(rubric)的奖励框架。该研究旨在通过细粒度监督解决多质量维度难以捕捉的问题。新方法在微调阶段生成了基于检索证据且分解为多个质量维度的特定查询评分表,从而提供精确的监督信号。实验结果显示,该方法在组成、grounding 和指令遵循三个关键评估轴上均实现了平均改进,有效提升了模型生成回答的质量与对齐度。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A Apple ML Research en 2026-08-27 08:00

从偏好到原则:基于评分标准的知识答案对齐方法

为开放域问答设计有效奖励信号面临挑战,因高质量回答需同时满足多个难以用整体标量捕捉的质量维度。研究团队引入基于评分表(rubric)的奖励框架,该框架生成基于检索证据且分解为多个质量维度的特定查询评分表,从而在微调阶段提供细粒度监督。该方法平均在组成、 grounding 和指令遵循三个评估轴上进行了改进。