AuraTracer智迹闻
中文

EVENT DOSSIER

Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring

2026-09-07 12:00 Models 🔥 42.2 heat score
1sources
1days unfolding
42.2heat score
0mentions
SummaryAI generated

The researchers proposed the Trait-Aware Policy Optimization (TAPO) framework for post-training autoregressive multi-trait essay scoring models. This method decomposes rewards along two dimensions: samples and traits, combining global scoring consistency, trait-level accuracy, format validity, and trait-dependentness; at the same time, by integrating original text and trait descriptions to enhance prompt words, it provides rich semantic information for generating trait-specific scores. Experiments show that TAPO outperforms supervised fine-tuning and scalar reward optimization baselines on multiple key models, demonstrating the effectiveness and transferability of trait-aware post-training in essay scoring.

Related eventsRELATED EVENTS

All reports (1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring

本文提出 Trait-Aware Policy Optimization (TAPO) 框架,用于后训练自回归多特质作文评分模型。该方法沿样本与特质两个维度分解奖励,结合全局评分一致性、特质级准确性、格式有效性及特质间依赖保持;同时通过融入原文本与特质描述增强提示词,为特质特定分数生成提供丰富语义信息。实验表明,TAPO 在多个骨干模型上均优于监督微调及标量奖励优化基线,证明了特质感知后训练在作文评分中的有效性与可迁移性。