智迹闻AuraTracer
EN

EVENT DOSSIER

“知道何时不应回答:音乐音频语言模型中用于回避的伪集合”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

针对音乐音频 - 语言模型在多项选择题中因被迫猜测导致误判的问题,研究者提出了一种基于单一预训练模型的伪集成方法以实现选择性弃权。该方法通过打乱候选答案顺序、腐蚀音频或交换选项标签等不改变正确答案的扰动方式生成多个预测分布,并计算其平均结果及不确定性度量(如熵、互信息)。在 TinyMU 模型于 MuChoMusic 数据集上的实验中,对四个答案顺序取平均使准确率从 55.7% 提升至 59.2%,且该不确定性指标比单次通过熵基线更能准确识别错误,将误差保留曲线下的面积从 0.293 降至 0.261。该方法仅需额外几次前向传播且无需重新训练,证明了弃权策略在紧凑型音乐音频 - 语言模型中的可行性。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
MuChoMusicTinyMU

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
MuChoMusic × TinyMU1

信号强度SIGNALS

关键词热度
  • TinyMU1
  • MuChoMusic1

全部报道(1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

Knowing When Not to Answer: Pseudo-Ensembles for Abstention in Music Audio-Language Models

针对音乐音频 - 语言模型在多项选择题中被迫猜测导致误判的问题,研究者构建了伪集成方法以实现选择性弃权。该方法利用单一预训练模型,通过打乱候选答案顺序、腐蚀音频或交换选项标签等不可改变正确答案的扰动方式生成多个预测分布,并计算其平均结果及相应的熵、互信息等不确定性度量。在 TinyMU 模型于 MuChoMusic 数据集上的实验中,对四个答案顺序取平均使准确率从 55.7% 提升至 59.2%,且该不确定性指标比单次通过熵基线更能准确识别错误,将误差保留曲线下的面积从 0.293 降至 0.261。该方法仅需额外几次前向传播且无需重新训练,使弃权策略在紧凑型音乐音频 - 语言模型中具备可行性。