InterSing: Explicit Interaction Dynamics for 3D Duet Singing Animation and Beyond
InterSing 提出一种生成逼真双人演唱 3D 头部动画的框架,解决了现有方法无法捕捉音乐显著时刻稀疏且节奏依赖的互动结构问题。该框架引入可解释的交互 logits 作为潜在表示,建模每个时间步的表演者间交叉参与度,并利用弱监督学习结合音频特征与交互动态驱动扩散模型。实验表明,InterSing 生成的动画在协调性与音乐对齐度上优于现有方法,同时保留了表演者的独特运动风格,且该公式同样适用于多歌手表演并提供直观的互动控制。