智迹闻AuraTracer
EN

EVENT DOSSIER

基于特征感知的政策优化方法:用于自回归多特征文章评分

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

研究人员提出 Trait-Aware Policy Optimization (TAPO) 框架,用于后训练自回归多特质作文评分模型。该方法沿样本与特质两个维度分解奖励,结合全局评分一致性、特质级准确性、格式有效性及特质间依赖保持;同时通过融入原文本与特质描述增强提示词,为特质特定分数生成提供丰富语义信息。实验表明,TAPO 在多个骨干模型上均优于监督微调及标量奖励优化基线,证明了特质感知后训练在作文评分中的有效性与可迁移性。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring

本文提出 Trait-Aware Policy Optimization (TAPO) 框架,用于后训练自回归多特质作文评分模型。该方法沿样本与特质两个维度分解奖励,结合全局评分一致性、特质级准确性、格式有效性及特质间依赖保持;同时通过融入原文本与特质描述增强提示词,为特质特定分数生成提供丰富语义信息。实验表明,TAPO 在多个骨干模型上均优于监督微调及标量奖励优化基线,证明了特质感知后训练在作文评分中的有效性与可迁移性。