摘要由 AI 生成
研究人员提出一种名为 DSSM-CRF 的新架构,旨在解决对话场景下语音情感识别中跨时间尺度声学证据与双向交互过程的协调难题。该架构将跨说话人上下文影响与说话人内部情感演变分离处理:利用双向状态空间模型在帧级和对话级编码融合自监督表示,并通过解码器将各说话人的 utterance 排序为独立动态条件随机场链。辅助目标监督每对连续 utterance 的情感变化,但不参与 Viterbi 推理,以确保互话轮次影响情感评分而不被视为另一说话人的轨迹过渡。在 IEMOCAP 数据集上,该方法实现了 75.81% 的未加权平均准确率(UA)和 74.90% 的加权平均准确率(WA);在 MELD 数据集上取得了 54.72% 的 WA 和 49.31% 的 F1 分数。对比实验表明,说话人因子分解与 CRF 建模带来…
关键实体KEY ENTITIES
DSSM-CRFIEMOCAPMELD
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
研究人员提出 DSSM-CRF 架构,用于解决对话中语音情感识别需协调跨时间尺度声学证据与双向交互过程的问题。该音频仅架构将跨说话人上下文影响与说话人内情感演变分离:双向状态空间模型在帧级和对话级编码融合自监督表示,解码器将各说话人 utterance 排序为独立动态条件随机场链。辅助目标监督每对连续 utterance 的情感变化但不参与 Viterbi 推理,确保互话轮次影响上下文情感评分而不被视为另一说话人的轨迹过渡。在 IEMOCAP 数据集上,该方法实现 75.81% UA 和 74.90% WA;在 MELD 数据集上取得 54.72% WA 和 49.31% WF1。匹配对照实验显示说话人因子分解与 CRF 建模带来互补增益。