CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution
CoSkill 提出一种统一的多智能体强化学习框架,将静态元技能工作流重构为可学习的元技能代理,并与推理代理在分层技能库上联合训练。该框架通过建模推理与元技能代理为共享单一骨干的合作团队,实现端到端协同适应:推理代理根据检索到的任务技能和子集步骤技能采取动作,其任务表现指导元技能代理优化这些步骤技能。在 ALFWorld 和 WebShop 实验表明,CoSkill 显著优于现有基于技能和强化学习基线,成功率达到 98.4% 和 90.6%,分别提升 3.5 和 6.2 个百分点,且在早期样本效率、渐近性能和墙钟效率方面表现更优。相关代码已开源。