智迹闻AuraTracer
EN

EVENT DOSSIER

强化学习的最优数据采集:一种大偏差视角

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

针对无限时域强化学习中数据获取效率低下的核心挑战,一项发表于 2026 年 9 月 7 日的研究提出了一种基于大偏差理论的统一框架。该研究将策略选择错误概率的指数衰减率确立为衡量数据获取效率的原则性指标,并通过大偏差理论推导其变分表征,构建了嵌套优化问题。为解决程序隐式且难以求解的特性,作者提出了带有显式约束的可解凸松弛方法,并开发了懒惰一步投影次梯度算法以构建自适应数据获取策略。实验结果表明,所得强化学习算法在最优性标准下近乎鲁棒最优(至多相差常数倍),且该框架可扩展至线性函数近似以提升可扩展性。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Optimal Data Acquisition for Reinforcement Learning: A Large Deviations Perspective

本文提出一种基于大偏差理论的统一框架,用于解决无限时域强化学习中数据获取效率这一核心挑战。研究将策略选择错误概率的指数衰减率确立为衡量效率的原则性指标,并通过大偏差理论推导其变分表征,形成嵌套优化问题。针对该程序隐式且难以求解的特性,作者提出了带有显式约束的可解凸松弛方法,并开发了懒惰一步投影次梯度算法以构建自适应数据获取策略。实验证明,所得强化学习算法在最优性标准下近乎鲁棒最优(至多相差常数倍),且该框架可扩展至线性函数近似以提升可扩展性。