智迹闻AuraTracer
EN

EVENT DOSSIER

CoSkill:用于分层技能进化的推理与元技能代理的联合强化学习

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

CoSkill 团队提出一种统一的多智能体强化学习框架,旨在通过联合训练推理代理与可学习的元技能代理,实现分层技能库上的协同适应。该框架将静态的元技能工作流重构为动态代理,使推理代理能根据检索到的任务技能和子步骤技能采取动作,其表现进而指导元技能代理优化这些技能。在 ALFWorld 和 WebShop 基准测试中,CoSkill 显著优于现有基线,成功率分别达到 98.4% 和 90.6%,较原有方法提升约 3.5 至 6.2 个百分点。此外,该框架在样本效率、渐近性能及墙钟效率方面均表现更优。相关代码已开源。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
CoSkilljinyuan-cookie

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
CoSkill × jinyuan-cookie1

信号强度SIGNALS

关键词热度
  • CoSkill1
  • jinyuan-cookie1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution

CoSkill 提出一种统一的多智能体强化学习框架,将静态元技能工作流重构为可学习的元技能代理,并与推理代理在分层技能库上联合训练。该框架通过建模推理与元技能代理为共享单一骨干的合作团队,实现端到端协同适应:推理代理根据检索到的任务技能和子集步骤技能采取动作,其任务表现指导元技能代理优化这些步骤技能。在 ALFWorld 和 WebShop 实验表明,CoSkill 显著优于现有基于技能和强化学习基线,成功率达到 98.4% 和 90.6%,分别提升 3.5 和 6.2 个百分点,且在早期样本效率、渐近性能和墙钟效率方面表现更优。相关代码已开源。