A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning
本文提出一种受 Schema 约束的语言模型,用于在不破坏局部学习的情况下完善机器人策略。在 NetLogo-Python 实现中,三台共享运动动力学但使用不同 LLM 后端的机器人独立结合 LLM 策略代理、UCB 带子和 Double DQN 控制器,且无中心 LLM 生成团队动作。LLM 推理被限制在回合级策略生成与完善,而非 tick 级动作选择;机器人通过包含策略、结果和学习反馈的共享回合摘要进行跨 LLM 通信。UCB 执行完善模式选择,而策略条件 Double DQN 基于导航变量、活跃策略参数和 LLM 动作先验执行 tick 级动作选择。在固定仿真中,完整配置在全部 90 个机器人 - 回合记录中均到达目标,实现了最低的中间完成时间(42 ticks)和第 90 百分位数(73.2 tick…