智迹闻AuraTracer
EN

EVENT DOSSIER

SiLR:用于LLM工具代理的结构保留接入与过程奖励机制

2026-09-07 12:00 大模型 🔥 40.2 事件热度
1家信源
1天持续发酵
40.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv cs.AI 发布论文 SiLR,提出一种针对大语言模型(LLM)工具代理的结构保持奖励方法。该研究旨在解决现有工具调用过程中结构信息丢失的问题,通过设计结构保持的准入和过程奖励机制,提升 LLM 在复杂任务中的工具使用效率与准确性。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
SiLR

信号强度SIGNALS

关键词热度
  • SiLR1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents

SiLR 提出一种基于分支级违规状态乘积序的运行时门控机制,在 Gym-ANM 等基准上使多动作恢复成功率从基线 0/21 提升至 21/21。该方法通过影子执行每个提议并依据过载分支支持与单分支严重度进行判定,证明了标量代理无法准确表示该顺序,其失败源于表征而非阈值调整。在 CityLearn 及三种模型家族测试中,确定性模拟门控将 LLM 置于信任边界之外,仅全分支谓词能防御幅度重分配攻击;相比之下,标量投影和单支支持均允许物理不安全动作,其中后者占比达 63.2%。作为 GRPO 过程奖励使用时,SiLR 在所有场景下优于计数投影,且是唯一使未门控策略表现超越未训练基线(0.844 vs 0.778)的奖励函数。