Labels have Human Values: Value Calibration of Subjective Tasks
提出 MultiCalibrated Subjective Task Learning (MC-STL) 框架以解决 NLP 模型在主观任务中忽略潜在价值结构导致预测校准偏差的问题。该框架通过标签理由相似性、专家价值分类或标注者社会文化描述符识别潜在价值组,并实施基于价值组的条件校准。MC-STL 适用于二元、序数和偏好学习设置,并在有毒聊天机器人对话、价值推理及 T2I 安全与偏好对齐等多个数据集上进行评估。实验结果表明,MC-STL 在相关价值组中实现多校准,同时提升了概率预测性能,表现优于现有基线模型。