《什么在驱动?用于组合式场景控制的局部运动表示》
研究人员提出了一种可提示的局部运动表示方法,旨在解决现有视频表征仅编码全局运动而缺乏个体实体局部运动的问题。该方法通过空间掩码定义用户指定区域,直接对完整视频进行条件化运动编码,而非裁剪输入或事后掩码特征,从而生成具有时间一致性和区域可寻址性的持久嵌入。实验表明,该技术在物体级运动转移和多演员视频的局部动作分类任务中均优于基于裁剪或后处理掩码的全局表征,提升了可控性并保留了用于消除歧义的全球上下文信息。
EVENT DOSSIER
研究人员在 arXiv 上发布了一项关于可提示局部运动表示方法的研究成果。该方法旨在解决现有视频表征仅编码全局运动而缺乏个体实体局部运动的问题。其核心机制是通过空间掩码定义用户指定的区域,直接对完整视频进行条件化运动编码,而非采用裁剪输入或事后掩码特征的方式。这种方法生成的嵌入具有时间一致性和区域可寻址性。实验结果显示,该技术在物体级运动转移和多演员视频的局部动作分类任务中表现优于基于裁剪或后处理掩码的全局表征方法,有效提升了可控性并保留了用于消除歧义的全球上下文信息。
研究人员提出了一种可提示的局部运动表示方法,旨在解决现有视频表征仅编码全局运动而缺乏个体实体局部运动的问题。该方法通过空间掩码定义用户指定区域,直接对完整视频进行条件化运动编码,而非裁剪输入或事后掩码特征,从而生成具有时间一致性和区域可寻址性的持久嵌入。实验表明,该技术在物体级运动转移和多演员视频的局部动作分类任务中均优于基于裁剪或后处理掩码的全局表征,提升了可控性并保留了用于消除歧义的全球上下文信息。