智迹闻AuraTracer
EN

EVENT DOSSIER

音频LLM中的音频接地与答案选择追踪

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

针对音频大语言模型(Audio LLMs)过度依赖文本线索而非音频信息的问题,一项发表于 arXiv 的研究通过实验探究了训练对声学证据使用的影响。研究发现:已训练模型在将音频替换为静音或不相关音频时,绩效下降幅度显著大于预训练模型;声学信息主要在早期至中间层塑造答案选择的表征,而训练过程主要增强中间至晚期层中音频对最终预测的影响;此外,训练期间学习的权重在特定层带中对模型表现影响最大。这些结果从机制上解释了训练如何加强 Audio LLMs 对声学证据的利用。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Tracing Audio Grounding and Answer Selection in Audio LLMs

本文针对音频大语言模型(Audio LLMs)过度依赖文本线索而非音频信息的问题,通过实验探究了训练如何强化声学证据的使用。研究发现:(1) 将音频替换为静音或不相关音频时,已训练模型的绩效下降幅度显著大于预训练模型;(2) 声学信息主要在早期至中间层塑造答案选择的表征,而训练主要增强中间至晚期层音频对最终预测的影响;(3) 训练期间学习的权重在特定层带中影响最大。这些结果从机制上解释了训练如何加强 Audio LLMs 对声学证据的利用。