Online Change-point Detection for Cooperative Multi-Agent Reinforcement Learning
本文提出一种基于奖励信号的在线变化点检测算法"Patterns of Past Rewards"(PPR),用于解决合作多智能体强化学习在环境或任务目标变更时的适应问题。PPR 是一种轻量级、与算法无关的检测器,通过平滑智能体的回报流并应用统计漂移检测器来标记显著偏移。研究在基于 Multi-Agent Particle Environment 的自定义 Speaker-Listener 环境中进行了评估,涵盖两种受控非平稳性场景。实验结果显示,直接对原始回报应用检测器容易遗漏变化,而平滑回报基线虽能更早检测但会产生大量重复警报;PPR 通过限制冗余检测同时识别控制偏移,实现了检测速度与警报稳定性的更好平衡。