智迹闻AuraTracer
EN

EVENT DOSSIER

“多臂强化学习能学到什么?代码化智能体的责任分配与可移植性”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

一项针对代码智能体的多 Harness 强化学习研究揭示了评价 Harness 的主导作用。通过对比“组内相对优势”机制下的两种分组规则,研究发现 Cross 分组规则能显著预测生成高质量 Harness(高出随机基准 4.48 个百分点),而 Within 规则无法做到。在 24,000 次密封评估中,该机制将解决率从 2.14% 大幅提升至 9.27%,提升幅度为训练食谱的 3.7 倍。实验进一步证实,两种分组规则对单个 Harness 的提升效果差异极小,但 Cross 规则带来的配置适应能力更强;尽管其可移植性并未优于 Within 规则,重新收集一半训练数据也未改变这一结论。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
AiderOpenHandsQwen CodeQwen3-8BSWE-agent

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Aider × OpenHands1Aider × Qwen Code1Aider × Qwen3-8B1Aider × SWE-agent1OpenHands × Qwen Code1OpenHands × Qwen3-8B1

信号强度SIGNALS

关键词热度
  • Qwen3-8B1
  • Aider1
  • OpenHands1
  • Qwen Code1
  • SWE-agent1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

“Multi-Harness RL能学到什么?代码化智能体的责任分配与可移植性”

研究团队在代码智能体领域隔离了多 Harness 强化学习中的“组内相对优势”机制,通过对比"Within"与"Cross"分组规则,发现评价 Harness 是主导变量:在 24,000 次密封评估中,该机制将解决率从 2.14% 提升至 9.27%,提升幅度为训练食谱的 3.7 倍。实验显示,两种分组规则对单个 Harness 的提升效果差异极小(置信区间包含零),且各自种子估计范围均大于两者之差;然而,Cross 规则的组间优势能显著预测生成 Harness(高出随机基准 4.48 个百分点),而 Within 规则无法做到。此外,重新收集一半训练数据并未改变这一结论,表明 Cross 规则带来的配置适应能力更强,但可移植性并未优于 Within 规则。