摘要由 AI 生成
Yihang Chen 等提出 Bilevel Coordinated Reflection 方法,将多智能体大语言模型系统建模为双层协调博弈。研究证明工人局部更新游戏属于近似势游戏,其均衡松弛度取决于任务分解质量;同时证实仅观察生成文本的网关无法在文本不可区分环境中统一改进记忆,而环境 grounded 的网关可以。据此提出的 SRMA(Stochastic Reflective Memory Ascent)算法仅在环境 grounded 评估风险严格下降时接受候选记忆,具备精确收敛及几何/多项式速率特性。在 500 个 SWE-bench 实例测试中,基于 Kimi 的系统解决率为 72.2%,高于公开 mini-SWE-agent 基准的 70.8%。
关键实体KEY ENTITIES
Meng FangWeilin LuoYihang ChenYuxiang ChenYuxuan Huang
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Yihang Chen1
- Yuxiang Chen1
- Yuxuan Huang1
- Meng Fang1
- Weilin Luo1
全部报道(1)SOURCES
↗
Yihang Chen 等提出 Bilevel Coordinated Reflection 方法,将多智能体 LLM 系统建模为双层协调博弈。该研究证明工人局部更新游戏是近似势游戏,其均衡松弛度取决于任务分解质量;同时证明仅观察生成文本的网关无法在文本不可区分环境中统一改进记忆,而环境 grounded 的网关可以。据此提出的 SRMA(Stochastic Reflective Memory Ascent)仅在环境 grounded 评估风险严格下降时接受候选记忆,具有精确收敛及几何/多项式速率。在 500 个 SWE-bench 实例上,基于 Kimi 的系统解决率为 72.2%,高于 70.8% 的公开 mini-SWE-agent 基准。