摘要由 AI 生成
一项研究提出利用强化学习(RL)方法提升大语言模型在低资源语言自动文本简化(ATS)方面的性能。该研究引入结合 SARI 指标与特定惩罚项的新型奖励函数,并通过组相对策略优化(GRPO)指导模型生成目标简化风格。实验基于 IberianLLM-7B-Instruct 模型进行验证:先在英语 ASSET 数据集上训练,随后在两个精选的加泰罗尼亚语基准测试中进行了后训练,结果显示模型在 ATS 任务上的性能得到提升,并成功抑制了此前观察到的负面行为。此外,研究尝试通过跨语言迁移学习将 ASSET 翻译为加泰罗尼亚语和西班牙语进行后训练,但未能显示出对域外基准测试的显著改进效果。
关键实体KEY ENTITIES
ASSETIberianLLM-7B-Instruct
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- IberianLLM-7B-Instruct1
- ASSET1
全部报道(1)SOURCES
↗
本文提出一种基于强化学习(RL)的方法,利用大语言模型(LLMs)提升低资源语言自动文本简化(ATS)质量。研究引入结合 SARI 指标与特定惩罚项的新型奖励函数,并通过组相对策略优化(GRPO)指导模型生成目标简化风格。该方案在 IberianLLM-7B-Instruct 模型上进行了后训练验证:基于英语 ASSET 数据集训练后,模型在两个精选的加泰罗尼亚语基准测试中 ATS 性能得到提升,并成功抑制了先前观察到的负面行为。此外,研究尝试通过跨语言迁移学习将 ASSET 翻译为加泰罗尼亚语和西班牙语进行后训练,但未能显示出对域外基准测试的显著改进效果。