智迹闻AuraTracer
EN

EVENT DOSSIER

通过贝叶斯视角统一ICL、SFT和KL正则化强化学习

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 发布一篇论文,提出一种基于贝叶斯视角的统一框架,旨在整合监督微调(SFT)、少样本上下文学习(ICL)及 KL 正则化强化学习(RL)。该研究将上述三种范式形式化为对贝叶斯后验预测的摊销与投影操作。具体方法分为两步:首先利用先验模型与效用信号构建广义贝叶斯后验;其次通过前向 KL 投影将其近似为参数化分布,分别对应权重内(SFT/RL)或上下文内(ICL)。论文进一步证明,KL 正则化的 RLHF/RLVR、奖励加权 SFT/ICL 及优势加权 SFT 均属于针对奖励或优势诱导后验的前向 KL 投影。此外,文章探讨了该框架对现代推理管道的启示,包括将 RLHF/RLVR 视为“后验设计加投影”过程,并强调了冷启动或监督预热对于重要性加权 KL 投影的必要性,同时提及了…

相关事件RELATED EVENTS
关键实体KEY ENTITIES
DeepSeek-R1

信号强度SIGNALS

关键词热度
  • DeepSeek-R11

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Unifying ICL, SFT, KL-Regularized RL Through a Bayesian Lens

本文提出一种贝叶斯视角,将监督微调(SFT)、少样本上下文学习(ICL)及 KL 正则化强化学习等范式统一。核心方法包含两步:(i) 利用先验模型与效用信号构建广义贝叶斯后验;(ii) 通过前向 KL 投影将其近似为参数化分布,分别对应权重内(SFT/RL)或上下文内(ICL)。文章第一部分形式化了少样本 ICL 和 SFT 为对贝叶斯后验预测的摊销与权重内投影;第二部分至第四部分证明 KL 正则化 RLHF/RLVR、奖励加权 SFT/ICL 及优势加权 SFT 均为针对奖励或优势诱导后验的前向 KL 投影。第五部分探讨了其对现代推理管道的启示,包括将 RLHF/RLVR 视为“后验设计 + 投影”、强调冷启动或监督预热对重要性加权 KL 投影的必要性,以及 DeepSeek-R1 和 o1 风格模型结合测…