摘要由 AI 生成
为了解决现有零-shot 3D 视觉定位方法依赖启发式规则而非定位相关性的问题,研究人员提出了 IVGround 框架。该框架通过训练轻量级视图选择器来识别提供判别性证据的视图,并利用两阶段拒绝采样过程结合推理 VLM 反馈生成监督信号。在推理阶段,选择器预测每个候选对象的条件化影响视图,并由冻结的推理 VLM 通过对比定位进行评估。实验表明,IVGround 框架在 ScanRefer 和 NR3D 数据集上的一致提升了现有零-shot 流程的定位精度,证明了“看哪里”对有效 3D 视觉定位至关重要。
关键实体KEY ENTITIES
IVSGroundNR3DScanRefer
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- IVSGround1
- ScanRefer1
- NR3D1
全部报道(1)SOURCES
↗
IVSGround 框架提出了一种用于 VLM 基于的 3D 视觉定位的影响性视图选择方法,旨在解决现有零-shot 方法依赖启发式规则而非定位相关性的问题。该框架通过训练轻量级视图选择器来识别提供判别性证据的视图,并利用两阶段拒绝采样过程结合推理 VLM 反馈生成监督信号。在推理阶段,选择器预测每个候选对象的条件化影响视图,并由冻结的推理 VLM 通过对比定位进行评估。在 ScanRefer 和 NR3D 数据集上的实验表明,IVSGround 一致地提升了现有零-shot 流程的定位精度,证明了“看哪里”对有效 3D 视觉定位至关重要。