Optimal Data Acquisition for Reinforcement Learning: A Large Deviations Perspective
本文提出一种基于大偏差理论的统一框架,用于解决无限时域强化学习中数据获取效率这一核心挑战。研究将策略选择错误概率的指数衰减率确立为衡量效率的原则性指标,并通过大偏差理论推导其变分表征,形成嵌套优化问题。针对该程序隐式且难以求解的特性,作者提出了带有显式约束的可解凸松弛方法,并开发了懒惰一步投影次梯度算法以构建自适应数据获取策略。实验证明,所得强化学习算法在最优性标准下近乎鲁棒最优(至多相差常数倍),且该框架可扩展至线性函数近似以提升可扩展性。