Knowing When Not to Answer: Pseudo-Ensembles for Abstention in Music Audio-Language Models
针对音乐音频 - 语言模型在多项选择题中被迫猜测导致误判的问题,研究者构建了伪集成方法以实现选择性弃权。该方法利用单一预训练模型,通过打乱候选答案顺序、腐蚀音频或交换选项标签等不可改变正确答案的扰动方式生成多个预测分布,并计算其平均结果及相应的熵、互信息等不确定性度量。在 TinyMU 模型于 MuChoMusic 数据集上的实验中,对四个答案顺序取平均使准确率从 55.7% 提升至 59.2%,且该不确定性指标比单次通过熵基线更能准确识别错误,将误差保留曲线下的面积从 0.293 降至 0.261。该方法仅需额外几次前向传播且无需重新训练,使弃权策略在紧凑型音乐音频 - 语言模型中具备可行性。