智迹闻AuraTracer
EN

EVENT DOSSIER

纸质页面——群体自适应裁剪策略优化

2026-09-07 08:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

Sheng Jia 等人提出一种名为“组自适应裁剪策略优化(GAPO)”的新方法,用于改进强化学习中的组相对策略优化。该方法针对现有固定重要性采样裁剪边界导致困难问题上正确样本被过度抑制的问题,通过根据滚动优势动态调整该边界来解决问题。GAPO 无需修改奖励塑造或目标函数,在 Qwen 和 Llama 基模型上均提升了数学推理基准的 pass@1 和 pass@k 表现。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Hugging FaceLlamaQwen

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Hugging Face × Llama1Hugging Face × Qwen1Llama × Qwen1

信号强度SIGNALS

关键词热度
  • Hugging Face1
  • Qwen1
  • Llama1

全部报道(1)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

Paper page - Group Adaptive Clipping Policy Optimization

Sheng Jia 等人提出一种名为“组自适应裁剪策略优化(GAPO)”的新方法,用于改进强化学习中的组相对策略优化。现有固定重要性采样裁剪边界导致困难问题上的正确样本被过度抑制,而 GAPO 通过根据滚动优势动态调整该边界来解决问题。该方法无需修改奖励塑造或目标函数,在 Qwen 和 Llama 基模型上均提升了数学推理基准的 pass@1 和 pass@k 表现。