Encore: Infinite Audio-Video Generation with Adaptive Signal Routing
arXiv:2609.04249v1 提出名为 Encore 的方法,旨在实现长视频与音频的同步生成。该方法将挑战分解为局部连续性和全局一致性两部分:前者通过带显式跨片段上下文传播的迭代生成处理,后者通过带有移位位置嵌入的参考音视频信号强制约束。为此,Encore 提出了自适应信号路由(ASR),在自注意力中引入可学习注意力偏差,并在交叉注意力输出上应用可学习残差缩放因子,使模型能自适应调节各条件信号的影响。训练时采用端到端方式,推理阶段支持基于真实模态条件的无限长度音视频合成。在扩展的 VerseBench 上的实验表明,Encore 在生成质量和时间连贯性方面显著优于现有方法。