摘要由 AI 生成
XDG 模型通过轻量级 LoRA 适配器微调 Depth Anything 3,将相机令牌重用作成对分类令牌,利用其跨视图几何推理能力进行视觉去歧义处理。该方法避免了重型解码器的额外计算开销。实验表明,XDG 在成对和重建基准测试中与最先进方法保持竞争力,同时提供超过 3 倍的推理速度提升;在包含数千张图像的单个 LaMAR 场景中,可节省超过 10 小时的视觉去歧义处理时间。相关代码已开源。
关键实体KEY ENTITIES
Depth Anything 3XDG
事件框架EVENT FRAME
产品发布
arXiv:2608.29733v2
XDG
提出高效视觉去重模型,推理速度提升 3 倍
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
XDG 模型通过轻量级 LoRA 适配器微调 Depth Anything 3,将相机令牌重用作成对分类令牌,实现了视觉去歧义的高效处理。该方法利用 3D 基础模型固有的跨视图几何推理能力,直接适配骨干网络表示,避免了重型解码器的额外计算开销。实验表明,XDG 在成对和重建基准测试中与最先进方法保持竞争力,同时提供超过 3 倍的推理速度提升;在包含数千张图像的单个 LaMAR 场景中,可节省超过 10 小时的视觉去歧义处理时间。代码已开源。