摘要由 AI 生成
研究团队首次提出 SoundMHPE 方法,旨在仅利用声学信号进行多人三维姿态估计。该框架包含两个核心组件:Acoustic Multi-scale Encoder 用于从复杂重叠的声学信号中分离细微特征;Temporal Pose Decoder 则通过注意力机制解耦跨帧信息以重建个体姿态。为验证该方法有效性,研究者构建了包含 43.2 万帧同步数据的 AMP 数据集。实验结果表明,SoundMHPE 在性能上优于现有基线模型。
关键实体KEY ENTITIES
AMPSoundMHPE
报道态势 · 每日报道量LANGUAGE SPLIT
信号强度SIGNALS
全部报道(1)SOURCES
↗
本文提出 SoundMHPE,一种仅利用声学信号估计多人 3D 姿态的首次尝试。该框架包含两个核心组件:Acoustic Multi-scale Encoder 用于从复杂重叠信号中分离细微声学特征,Temporal Pose Decoder 则通过注意力机制解耦跨帧的多人体信息以重建个体姿态。为验证该方法,研究者构建了包含 43.2 万帧同步数据的 AMP 数据集,实验表明 SoundMHPE 优于基线模型。