摘要由 AI 生成
研究人员提出 EvoCUA-1.5 框架,将自进化计算机使用代理从离线经验学习扩展至在线强化学习。该框架在可执行沙箱环境中,通过 Step-Level Policy Optimization、策略感知过滤及动态自适应课程等机制解决多轮交互中的上下文管理与稀疏奖励挑战。实验表明,EvoCUA-1.5 在 OSWorld-Verified 基准上取得 63.2% 的成功率,优于同等规模开源基线并接近大参数模型性能。同时,相关研究提出将交互轨迹转化为持久化过程库的在线演化框架,结果显示该机制能提升固定计算机使用栈的性能,但收益具有条件性且重复修订无法保证恢复原始任务状态。
关键实体KEY ENTITIES
EvoCUA-1.5GIMPOSWorldarXiv
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-07
EvoCUA-1.5: Online Reinforcement Learni…
EvoCUA-1.5 将自进化计算机使用代理从离线经验学习扩展至在线强化学习,在可执行沙箱环境中通过可验证任务结果改进策略。该模型针对多轮交互中的上下文管理、稀疏奖励及慢速反馈挑战,采用 Step-Level Policy Optimiz…
2 条报道
信号强度SIGNALS
关键词热度
- arXiv1
- OSWorld1
- GIMP1
- EvoCUA-1.51
全部报道(2)SOURCES
↗
研究人员提出了一种将交互轨迹和评估反馈转化为持久化、版本化可重用过程库的在线技能演化框架。该框架在每次迭代中针对冻结的库快照执行,证据导向的技能更新可在后续迭代中生效而无需修改模型参数。研究者在四个 OSWorld 应用域内,对比了全演化库系统与空库控制组(配置匹配),结果显示在五次迭代预热后,全演化库系统在四个观测域的运行中均获得了更高的后期评估分数,平均差异范围为 5.7 至 18.6 个百分点,并表现出领域相关的时序稳定性。针对 GIMP 领域的溯源分析揭示了跨任务起源边界的检索及修订波动,表明重复接受的编辑无法恢复原始任务。这些发现将演化技能库定义为可审计、共享的过程记忆,证明其能提升固定计算机使用栈的性能,同时也显示其收益具有条件性且重复修订不能保证恢复。相关代码已发布在 GitHub 上。
↗
EvoCUA-1.5 将自进化计算机使用代理从离线经验学习扩展至在线强化学习,在可执行沙箱环境中通过可验证任务结果改进策略。该模型针对多轮交互中的上下文管理、稀疏奖励及慢速反馈挑战,采用 Step-Level Policy Optimization (STEPO)、策略感知过滤与通过率校准、动态三自适应课程(DTAC)以及带过时控制的异步 RL 基础设施。实验显示这些组件提升了训练稳定性与下游性能,EvoCUA-1.5 在 OSWorld-Verified 上取得 63.2% 的成功率,优于同等规模的开源基线并接近参数量更大的模型。