Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
本文提出 Trait-Aware Policy Optimization (TAPO) 框架,用于后训练自回归多特质作文评分模型。该方法沿样本与特质两个维度分解奖励,结合全局评分一致性、特质级准确性、格式有效性及特质间依赖保持;同时通过融入原文本与特质描述增强提示词,为特质特定分数生成提供丰富语义信息。实验表明,TAPO 在多个骨干模型上均优于监督微调及标量奖励优化基线,证明了特质感知后训练在作文评分中的有效性与可迁移性。