Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
2026-09-07 12:00Models🔥 42.2 heat score
1sources
1days unfolding
42.2heat score
0mentions
SummaryAI generated
The researchers proposed the Trait-Aware Policy Optimization (TAPO) framework for post-training autoregressive multi-trait essay scoring models. This method decomposes rewards along two dimensions: samples and traits, combining global scoring consistency, trait-level accuracy, format validity, and trait-dependentness; at the same time, by integrating original text and trait descriptions to enhance prompt words, it provides rich semantic information for generating trait-specific scores. Experiments show that TAPO outperforms supervised fine-tuning and scalar reward optimization baselines on multiple key models, demonstrating the effectiveness and transferability of trait-aware post-training in essay scoring.