摘要由 AI 生成
研究人员提出一种新型多模态情感识别框架,通过结合音频与视频数据进行情感分析。该框架在音频端提取语义嵌入、MFCC 特征及声学统计量,并利用 BiLSTM 进行对齐融合;在视频端采用 ResNet50-BiLSTM 架构提取时空特征。此外,引入基于多头注意力的特征级融合机制以增强模态间的协同效应。实验表明,该模型在 MELD 和 IEMOCAP 数据集上的准确性和鲁棒性显著优于基线方法,特别是在数据不平衡场景下表现更佳。
关键实体KEY ENTITIES
BiLSTMIEMOCAPMELDResNet50Wav2Vec2
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Wav2Vec21
- ResNet501
- BiLSTM1
- MELD1
- IEMOCAP1
全部报道(1)SOURCES
↗
本文提出了一种基于多特征编码与注意力融合的多模态情感识别新框架。该框架在音频端提取语义嵌入、MFCC 特征及声学统计量,通过 BiLSTM 对齐融合;在视频端采用 ResNet50-BiLSTM 架构提取时空特征;并引入基于多头注意力的特征级融合机制以增强模态协同。在 MELD 和 IEMOCAP 数据集上的实验表明,该模型在准确性和鲁棒性上显著优于基线方法,且注意力融合策略在数据不平衡场景下表现更优。