智迹闻AuraTracer
EN

EVENT DOSSIER

用于提升大型语言模型简化加泰罗尼亚文本能力的强化学习

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

一项研究提出利用强化学习(RL)方法提升大语言模型在低资源语言自动文本简化(ATS)方面的性能。该研究引入结合 SARI 指标与特定惩罚项的新型奖励函数,并通过组相对策略优化(GRPO)指导模型生成目标简化风格。实验基于 IberianLLM-7B-Instruct 模型进行验证:先在英语 ASSET 数据集上训练,随后在两个精选的加泰罗尼亚语基准测试中进行了后训练,结果显示模型在 ATS 任务上的性能得到提升,并成功抑制了此前观察到的负面行为。此外,研究尝试通过跨语言迁移学习将 ASSET 翻译为加泰罗尼亚语和西班牙语进行后训练,但未能显示出对域外基准测试的显著改进效果。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
ASSETIberianLLM-7B-Instruct

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
ASSET × IberianLLM-7B-I…1

信号强度SIGNALS

关键词热度
  • IberianLLM-7B-Instruct1
  • ASSET1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Reinforcement Learning for improving Large Language Models' Catalan text simplification capabilities

本文提出一种基于强化学习(RL)的方法,利用大语言模型(LLMs)提升低资源语言自动文本简化(ATS)质量。研究引入结合 SARI 指标与特定惩罚项的新型奖励函数,并通过组相对策略优化(GRPO)指导模型生成目标简化风格。该方案在 IberianLLM-7B-Instruct 模型上进行了后训练验证:基于英语 ASSET 数据集训练后,模型在两个精选的加泰罗尼亚语基准测试中 ATS 性能得到提升,并成功抑制了先前观察到的负面行为。此外,研究尝试通过跨语言迁移学习将 ASSET 翻译为加泰罗尼亚语和西班牙语进行后训练,但未能显示出对域外基准测试的显著改进效果。