Paper page - Group Adaptive Clipping Policy Optimization
Sheng Jia 等人提出一种名为“组自适应裁剪策略优化(GAPO)”的新方法,用于改进强化学习中的组相对策略优化。现有固定重要性采样裁剪边界导致困难问题上的正确样本被过度抑制,而 GAPO 通过根据滚动优势动态调整该边界来解决问题。该方法无需修改奖励塑造或目标函数,在 Qwen 和 Llama 基模型上均提升了数学推理基准的 pass@1 和 pass@k 表现。
EVENT DOSSIER
Sheng Jia 等人提出一种名为“组自适应裁剪策略优化(GAPO)”的新方法,用于改进强化学习中的组相对策略优化。该方法针对现有固定重要性采样裁剪边界导致困难问题上正确样本被过度抑制的问题,通过根据滚动优势动态调整该边界来解决问题。GAPO 无需修改奖励塑造或目标函数,在 Qwen 和 Llama 基模型上均提升了数学推理基准的 pass@1 和 pass@k 表现。
Sheng Jia 等人提出一种名为“组自适应裁剪策略优化(GAPO)”的新方法,用于改进强化学习中的组相对策略优化。现有固定重要性采样裁剪边界导致困难问题上的正确样本被过度抑制,而 GAPO 通过根据滚动优势动态调整该边界来解决问题。该方法无需修改奖励塑造或目标函数,在 Qwen 和 Llama 基模型上均提升了数学推理基准的 pass@1 和 pass@k 表现。