DART:用于手术视觉基础模型的深度目标预训练方法
DART 提出一种基于深度作为目标的预训练方法,利用伪标签深度信号提升手术视觉基础模型性能。该方法在 DINOv2 基础上增加像素空间深度重建目标,仅用于预训练阶段,推理仍保持 RGB 单模态。实验表明,深度信息比边缘等替代信号更能有效编码场景几何结构,且该像素级重建头能改善而非破坏表示质量。在涵盖分割、深度估计及图像识别的八个手术基准测试中,DART 优于自然图像预训练基线及同域基线,实现了密集预测与图像理解的双重增强。
EVENT DOSSIER
2026 年 9 月 7 日,arXiv cs.CV 发布 DART 方法,旨在通过引入深度作为预训练目标来增强手术视觉基础模型。该方法基于 DINOv2 架构,在预训练阶段增加像素空间深度重建任务以利用伪标签深度信号,而推理阶段仍保持 RGB 单模态输入。实验结果显示,相较于边缘等替代信号,深度信息能更有效地编码场景几何结构,且该像素级重建头能够改善而非破坏模型的表示质量。在涵盖分割、深度估计及图像识别的八个手术基准测试中,DART 方法的表现优于自然图像预训练基线及同领域现有基线,实现了密集预测与图像理解的双重增强。
DART 提出一种基于深度作为目标的预训练方法,利用伪标签深度信号提升手术视觉基础模型性能。该方法在 DINOv2 基础上增加像素空间深度重建目标,仅用于预训练阶段,推理仍保持 RGB 单模态。实验表明,深度信息比边缘等替代信号更能有效编码场景几何结构,且该像素级重建头能改善而非破坏表示质量。在涵盖分割、深度估计及图像识别的八个手术基准测试中,DART 优于自然图像预训练基线及同域基线,实现了密集预测与图像理解的双重增强。