Persistent Teacher Anchoring for Tool-Using Agents
提出一种名为持久教师锚定(PTA)的方法,用于解决工具使用代理中因学生生成轨迹与教师分布差异导致的漂移问题。该方法通过引入转级承诺机制,确保工具调用在执行前必须经过教师对整个回合的验证,并将已验证片段视为原子生成单元;同时结合持久前瞻技术,在固定验证器下利用空闲滚动容量推进未来样本并携带未完成样本跨越学生更新。实验表明,在 Search-R1 风格和 DeepEyes 风格的检索与感知强化学习中,应用 PTA 相比 OPKD 方法,在相同下游 RL 预算下使宏观最佳@4 提升 2.5 至 2.8 分,而前瞻技术使吞吐量提升 24%。