MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision
MINT 模型首次直接基于自视角 RGB 视频生成世界坐标系下的双手轨迹。该模型通过共享时空视频表示,联合预测相机轨迹、相机帧内手部状态及逐帧手部存在情况,再经显式坐标变换输出世界空间手部运动。为解决世界空间相机与手部标注稀缺问题,研究团队开发了开源标注工具 EGOPIPELINE,将公共自视角视频转化为结构化监督数据。MINT 先在大规模伪标签上预训练,再在小量高质量联合标注集上微调。在公开基准测试中,MINT 在手部轨迹准确性、相机轨迹估计及端到端生成速度方面均取得显著提升,并能零样本泛化至未见过的自视角数据集。团队已开源模型代码、推理代码、标注工具及包含 1,021 小时的 curated 自视角轨迹数据集。