摘要由 AI 生成
一项针对代码智能体的多 Harness 强化学习研究揭示了评价 Harness 的主导作用。通过对比“组内相对优势”机制下的两种分组规则,研究发现 Cross 分组规则能显著预测生成高质量 Harness(高出随机基准 4.48 个百分点),而 Within 规则无法做到。在 24,000 次密封评估中,该机制将解决率从 2.14% 大幅提升至 9.27%,提升幅度为训练食谱的 3.7 倍。实验进一步证实,两种分组规则对单个 Harness 的提升效果差异极小,但 Cross 规则带来的配置适应能力更强;尽管其可移植性并未优于 Within 规则,重新收集一半训练数据也未改变这一结论。
关键实体KEY ENTITIES
AiderOpenHandsQwen CodeQwen3-8BSWE-agent
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Qwen3-8B1
- Aider1
- OpenHands1
- Qwen Code1
- SWE-agent1
全部报道(1)SOURCES
↗
研究团队在代码智能体领域隔离了多 Harness 强化学习中的“组内相对优势”机制,通过对比"Within"与"Cross"分组规则,发现评价 Harness 是主导变量:在 24,000 次密封评估中,该机制将解决率从 2.14% 提升至 9.27%,提升幅度为训练食谱的 3.7 倍。实验显示,两种分组规则对单个 Harness 的提升效果差异极小(置信区间包含零),且各自种子估计范围均大于两者之差;然而,Cross 规则的组间优势能显著预测生成 Harness(高出随机基准 4.48 个百分点),而 Within 规则无法做到。此外,重新收集一半训练数据并未改变这一结论,表明 Cross 规则带来的配置适应能力更强,但可移植性并未优于 Within 规则。