Generating Constructive Feedback on Stories via Reinforcement Learning
研究人员提出一种强化学习方法,利用组相对策略优化(GRPO)引导大语言模型生成建设性反馈,无需真实反馈数据。该方法采用新颖的多组件奖励函数,优先选择针对故事独特、能提升质量并解决关键写作问题的反馈。在三个故事语料库的自动与人工评估中,该方案表现优于包括 Gemini 在内的最先进大语言模型及竞争性基线。研究证实,提供可操作建议是驱动反馈建设性的主要因素。
EVENT DOSSIER
研究人员提出一种基于强化学习(RL)的方法,利用组相对策略优化(GRPO)引导大语言模型生成针对故事的具有建设性的反馈。该方法创新性地采用多组件奖励函数,优先选择能提升质量、解决关键写作问题且针对故事独特性的反馈,无需依赖真实反馈数据。在三个故事语料库进行的自动与人工评估中,该方案表现优于包括 Gemini 在内的最先进大语言模型及竞争性基线。研究证实,提供可操作建议是驱动反馈建设性的主要因素。
研究人员提出一种强化学习方法,利用组相对策略优化(GRPO)引导大语言模型生成建设性反馈,无需真实反馈数据。该方法采用新颖的多组件奖励函数,优先选择针对故事独特、能提升质量并解决关键写作问题的反馈。在三个故事语料库的自动与人工评估中,该方案表现优于包括 Gemini 在内的最先进大语言模型及竞争性基线。研究证实,提供可操作建议是驱动反馈建设性的主要因素。