智迹闻AuraTracer
EN

EVENT DOSSIER

一种用于优化机器人策略的架构受限语言模型,不会破坏局部学习机制的稳定性

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

研究人员提出一种受 Schema 约束的语言模型,旨在完善机器人策略而不破坏局部学习。该方案在 NetLogo-Python 实现的三台机器人系统中进行测试,这些机器人共享运动动力学但使用不同的 LLM 后端。系统采用无中心 LLM 生成团队动作的架构,将 LLM 推理限制在回合级策略生成与完善阶段,而非 tick 级的具体动作选择。各机器人通过包含策略、结果和学习反馈的共享回合摘要进行跨 LLM 通信,并由 UCB 执行模式选择,策略条件 Double DQN 基于导航变量等执行 tick 级动作选择。在固定仿真环境中,该完整配置在所有 90 个机器人 - 回合记录中均成功到达目标,实现了最低的中间完成时间(42 ticks)和第 90 百分位数(73.2 ticks)。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
NetLogoPython

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
NetLogo × Python1

信号强度SIGNALS

关键词热度
  • NetLogo1
  • Python1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning

本文提出一种受 Schema 约束的语言模型,用于在不破坏局部学习的情况下完善机器人策略。在 NetLogo-Python 实现中,三台共享运动动力学但使用不同 LLM 后端的机器人独立结合 LLM 策略代理、UCB 带子和 Double DQN 控制器,且无中心 LLM 生成团队动作。LLM 推理被限制在回合级策略生成与完善,而非 tick 级动作选择;机器人通过包含策略、结果和学习反馈的共享回合摘要进行跨 LLM 通信。UCB 执行完善模式选择,而策略条件 Double DQN 基于导航变量、活跃策略参数和 LLM 动作先验执行 tick 级动作选择。在固定仿真中,完整配置在全部 90 个机器人 - 回合记录中均到达目标,实现了最低的中间完成时间(42 ticks)和第 90 百分位数(73.2 tick…