“物体的概念源于运动”
研究人员提出一种受生物启发的框架,利用运动边界从原始视频中为单张图像学习以物体为中心的视觉表示。该方法结合现成光流与聚类生成伪实例掩码,监督单图像编码器进行像素级成对度量学习,无需人工标注或相机标定。团队首先从 7,163 小时驾驶及网络视频中提取 1.95 亿个伪标签帧,再通过运动验证自训练扩展至 4.21 亿帧。经训练的编码器最高达 Swin-H 级别,并将表示蒸馏至一系列 Swin 骨干网络中。在单目深度估计、3D 物体检测、3D 占用预测及端到端规划任务上,该模型表现优于或媲美监督与自监督预训练基线,尤其在几何和实例敏感任务上转移效果显著。