AVENUE: Audio-Video EditiNg Understanding and Evaluation
研究人员推出 AVENUE(Audio-Video EditiNg Understanding and Evaluation),旨在解决音频 - 视频编辑中模型难以忠实保留非目标模态的问题。该框架包含两项核心贡献:一是涵盖 1,291 个源片段和 7,957 条编辑指令的基准数据集,覆盖音频、视频及音视频耦合三种类型;二是构建了一个样本特定且模态感知的评估体系,明确指定每个样本的预期修改与需保留内容。研究对联合、顺序及分离三种编辑范式下的代表性模型进行了系统分析,发现现有模型在编辑一种模态时,常会在另一种模态中引发非预期变化,无论其所属范式如何。AVENUE 数据集已公开于 Hugging Face。