智迹闻AuraTracer
EN

EVENT DOSSIER

EVOHARNESSBENCH:您的代理能否跟上不断发展的线束发展步伐?

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员于 2026 年 9 月 7 日发布 EVOHARNESSBENCH,这是一个用于评估智能体在工具、技能和专家智能体三个维度上受控演化的基准。该基准包含 17 个多阶段流,涵盖 802 个任务、520 种工具、42 项技能和 62 个智能体,将非平稳性置于外部提供的 harness 本身而非任务流中。研究评估了部署评估(隔离能力保留)和自我演化适应评估(测试经验效用)两种互补设置。结果揭示了三个持久差距:一是 harness 扩展可导致先前解决的任务性能下降,产生 harness 诱导遗忘;二是自我演化适应收益在不同阶段、能力和环境中不一致;三是保留早期能力与适应新能力往往方向相悖。这些结果确立了 harness 演化为构建能随其进化并保持有效行为的智能体的独特挑战。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
EVOHARNESSBENCH

信号强度SIGNALS

关键词热度
  • EVOHARNESSBENCH1

全部报道(1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness?

研究人员发布 EVOHARNESSBENCH,这是一个用于评估智能体在工具、技能和专家智能体三个维度上受控演化的基准。该基准包含 17 个多阶段流,涵盖 802 个任务、520 种工具、42 项技能和 62 个智能体,将非平稳性置于外部提供的 harness 本身而非任务流中。研究评估了部署评估(隔离能力保留)和自我演化适应评估(测试经验效用)两种互补设置。结果揭示了三个持久差距:一是 harness 扩展可导致先前解决的任务性能下降,产生 harness 诱导遗忘;二是自我演化适应收益在不同阶段、能力和环境中不一致;三是保留早期能力与适应新能力往往方向相悖。这些结果确立了 harness 演化为构建能随其进化并保持有效行为的智能体的独特挑战。