Reinforcement Learning for Sequential Solar PV Policy Design under Uncertainty: An Agent-Based Approach
本研究将太阳能光伏(PV)政策设计建模为序贯决策问题,结合强化学习(RL)与随机智能体模型(ABM),在 16 年周期内模拟 PV 采纳过程。Policymaker agent 选择资本补贴、优惠贷款利率及上网电价等年度激励措施,并通过 PPO、SAC 和 TD3 算法学习策略。结果显示,TD3 算法在 $w_{\text{cost}}=0.5$ 时实现约 4,145 个采纳者(成本 4173 万欧元),PPO 算法在 $w_{\text{cost}}=2.0$ 时将支出降至 727 万欧元但采纳者为 2682 个;平衡策略(PPO,$w_{\text{cost}}=1.6$)实现 3495 个采纳者(成本 2247 万欧元)。跨算法观察到一致的权衡模式,表明该 RL 框架在不确定性下探索了比静态基准政策更广…