EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness?
研究人员发布 EVOHARNESSBENCH,这是一个用于评估智能体在工具、技能和专家智能体三个维度上受控演化的基准。该基准包含 17 个多阶段流,涵盖 802 个任务、520 种工具、42 项技能和 62 个智能体,将非平稳性置于外部提供的 harness 本身而非任务流中。研究评估了部署评估(隔离能力保留)和自我演化适应评估(测试经验效用)两种互补设置。结果揭示了三个持久差距:一是 harness 扩展可导致先前解决的任务性能下降,产生 harness 诱导遗忘;二是自我演化适应收益在不同阶段、能力和环境中不一致;三是保留早期能力与适应新能力往往方向相悖。这些结果确立了 harness 演化为构建能随其进化并保持有效行为的智能体的独特挑战。