智迹闻AuraTracer
EN

EVENT DOSSIER

《关注何处寻找:学习基于VLM的3D视觉定位的 influential views》

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

为了解决现有零-shot 3D 视觉定位方法依赖启发式规则而非定位相关性的问题,研究人员提出了 IVGround 框架。该框架通过训练轻量级视图选择器来识别提供判别性证据的视图,并利用两阶段拒绝采样过程结合推理 VLM 反馈生成监督信号。在推理阶段,选择器预测每个候选对象的条件化影响视图,并由冻结的推理 VLM 通过对比定位进行评估。实验表明,IVGround 框架在 ScanRefer 和 NR3D 数据集上的一致提升了现有零-shot 流程的定位精度,证明了“看哪里”对有效 3D 视觉定位至关重要。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
IVSGroundNR3DScanRefer

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
IVSGround × NR3D1IVSGround × ScanRefer1NR3D × ScanRefer1

信号强度SIGNALS

关键词热度
  • IVSGround1
  • ScanRefer1
  • NR3D1

全部报道(1)SOURCES

A arXiv cs.CV en 2026-09-07 12:00

Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding

IVSGround 框架提出了一种用于 VLM 基于的 3D 视觉定位的影响性视图选择方法,旨在解决现有零-shot 方法依赖启发式规则而非定位相关性的问题。该框架通过训练轻量级视图选择器来识别提供判别性证据的视图,并利用两阶段拒绝采样过程结合推理 VLM 反馈生成监督信号。在推理阶段,选择器预测每个候选对象的条件化影响视图,并由冻结的推理 VLM 通过对比定位进行评估。在 ScanRefer 和 NR3D 数据集上的实验表明,IVSGround 一致地提升了现有零-shot 流程的定位精度,证明了“看哪里”对有效 3D 视觉定位至关重要。