Testing Interchangeability in LLM Agent Teams
一项针对大语言模型智能体团队可互换性的测试表明,虽然角色替换对任务得分影响甚微,但会显著增加沟通成本。研究在相同任务和基座模型上独立构建了八个团队,通过交换匹配角色的智能体并测量其在保留任务上的表现,发现与仅改变座位而不改变人员的安慰剂相比,角色互换使团队单位进展的沟通量增加了 16% 至 63%。具体而言,在 Hanabi 任务中,被替换的智能体比新手更昂贵;在 Collab-Overcooked 中,议程制定者被替换时,剩余智能体的额外沟通占主导。此外,针对基座模型、解码温度和形成长度的消融实验显示,贪婪解码降低了互换惩罚与团队漂移程度,而加倍团队历史则同时提高了两者。总体而言,智能体在任务结果上比在协调效率上更具可互换性,且形成历史越长,互换效应越显著。