智迹闻AuraTracer
EN

EVENT DOSSIER

通过多特征编码和基于注意力的融合来提升多模态情感识别能力

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

研究人员提出一种新型多模态情感识别框架,通过结合音频与视频数据进行情感分析。该框架在音频端提取语义嵌入、MFCC 特征及声学统计量,并利用 BiLSTM 进行对齐融合;在视频端采用 ResNet50-BiLSTM 架构提取时空特征。此外,引入基于多头注意力的特征级融合机制以增强模态间的协同效应。实验表明,该模型在 MELD 和 IEMOCAP 数据集上的准确性和鲁棒性显著优于基线方法,特别是在数据不平衡场景下表现更佳。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
BiLSTMIEMOCAPMELDResNet50Wav2Vec2

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
BiLSTM × IEMOCAP1BiLSTM × MELD1BiLSTM × ResNet501BiLSTM × Wav2Vec21IEMOCAP × MELD1IEMOCAP × ResNet501

信号强度SIGNALS

关键词热度
  • Wav2Vec21
  • ResNet501
  • BiLSTM1
  • MELD1
  • IEMOCAP1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Enhancing Multimodal Emotion Recognition via Multi-Feature Encoding and Attention-Based Fusion

本文提出了一种基于多特征编码与注意力融合的多模态情感识别新框架。该框架在音频端提取语义嵌入、MFCC 特征及声学统计量,通过 BiLSTM 对齐融合;在视频端采用 ResNet50-BiLSTM 架构提取时空特征;并引入基于多头注意力的特征级融合机制以增强模态协同。在 MELD 和 IEMOCAP 数据集上的实验表明,该模型在准确性和鲁棒性上显著优于基线方法,且注意力融合策略在数据不平衡场景下表现更优。