智迹闻AuraTracer
EN

EVENT DOSSIER

论文页面 - RISE:通过自外推策略蒸馏实现递归改进

2026-09-07 21:57 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
4个提及
摘要由 AI 生成

2026 年 9 月 7 日,Salesforce AI Research 团队提出名为 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)的新型大模型训练方法。该方法旨在解决语言模型后训练阶段教师模型质量受限的问题,无需依赖外部教师或特权数据。RISE 利用模型自身的强化学习验证轨迹,通过自外推技术将稀疏的参数更新转化为稠密的 token 级监督信号。具体而言,算法基于当前检查点与尾部锚点的位移进行外推,结合结果奖励引导方向并细化 token 决策,形成递归改进循环。实验涵盖数学推理、多领域 STEM、代码生成及多轮智能体任务,结果显示 RISE 在所有测试设置下均优于仅使用 RLVR 训练或基于策略的自蒸馏方法。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Hugging FaceRISESalesforce AI Researchtaesiri

事件框架EVENT FRAME

产品发布

Salesforce AI Research RISE 提出基于自外推策略蒸馏的递归改进大模型方法

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Hugging Face × Salesfor…1Hugging Face × taesiri1Salesforce AI Research …1

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    RISE: Recursive Improvement via Self-Ex…

    arXiv:2609.05295v1 提出名为 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)的新方法,旨在通过自外推策略蒸馏解决语言模型后训练…

    2 条报道

信号强度SIGNALS

关键词热度
  • RISE1
  • Salesforce AI Research1
  • taesiri1
  • Hugging Face1

全部报道(2)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

arXiv:2609.05295v1 提出名为 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)的新方法,旨在通过自外推策略蒸馏解决语言模型后训练中的教师质量瓶颈。该方法利用模型自身的 RLVR 训练轨迹构建合成教师,通过外推当前检查点与尾部锚点之间的位移,将稀疏的参数更新转化为稠密的 token 级目标,无需外部模型或特权条件。RISE 将 RLVR 与 OPD 结合为互补循环:结果奖励引导外推方向,外推教师细化 token 决策,且教师随学生迭代刷新形成递归改进机制。实验涵盖数学推理、多领域 STEM、代码生成及多轮智能体任务,结果显示 RISE 在所有设置下均优于仅 RLVR 训练和 OPD 自蒸馏。

H Hugging Face Papers en 2026-09-07 21:57

论文页面 - RISE:通过自外推策略蒸馏实现递归改进

Salesforce AI Research 团队提出 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation),通过自外推技术从模型自身强化学习轨迹中递归生成稠密 token 级监督,无需外部教师。该方法利用当前检查点与尾部锚点之间的位移进行外推,将稀疏结果诱导参数更新转化为稠密目标。实验涵盖数学推理、多领域 STEM、代码生成及多轮智能体任务,结果显示 RISE 在所有设置下均优于仅使用 RLVR 训练和基于策略的自蒸馏方法。