智迹闻AuraTracer
EN

EVENT DOSSIER

超越成对偏好:用于扩散模型的列表级奖励感知对齐方法

2026-09-07 12:00 大模型 🔥 40.2 事件热度
1家信源
1天持续发酵
40.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv cs.LG 发布论文《Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models》。该研究针对现有扩散模型依赖成对偏好进行对齐的局限性,提出了一种列表式奖励感知对齐新范式。该方法通过引入列表形式的奖励信号,使模型能够同时考虑多个样本间的相对关系与整体分布特性,从而在保持生成质量的同时提升对齐效率与效果,为扩散模型的优化提供了新的技术路径。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Diffusion LAIR

信号强度SIGNALS

关键词热度
  • Diffusion LAIR1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

arXiv:2605.26491v2 提出 Diffusion LAIR,一种针对扩散模型的奖励感知列表式偏好优化方法。该方法将同一提示词下候选图像的奖励分数转化为中心化优势权重,在隐式奖励(定义为当前模型相对于固定参考模型的去噪损失改进)上优化加权回归目标,并引入二次惩罚正则化其幅度。实验表明,Diffusion LAIR 在 SD1.5 和 SDXL 模型上的文本生成、组合生成及图像编辑基准测试中,均优于现有的强偏好优化基线方法。