Tracing Audio Grounding and Answer Selection in Audio LLMs
本文针对音频大语言模型(Audio LLMs)过度依赖文本线索而非音频信息的问题,通过实验探究了训练如何强化声学证据的使用。研究发现:(1) 将音频替换为静音或不相关音频时,已训练模型的绩效下降幅度显著大于预训练模型;(2) 声学信息主要在早期至中间层塑造答案选择的表征,而训练主要增强中间至晚期层音频对最终预测的影响;(3) 训练期间学习的权重在特定层带中影响最大。这些结果从机制上解释了训练如何加强 Audio LLMs 对声学证据的利用。