LookThere! Sparse Vision by Reinforced Selection
LookThere 通过端到端强化学习框架,在无需辅助信号的情况下仅处理任务相关输入,实现了性能与计算量的帕累托前沿突破。该方法联合训练浅层输入选择器与深层表示提取器,使模型仅需 0.2% 的输入即可在交通标志、台球等高分辨率稀疏识别场景中保持高精度,并支持 ImageNet 分类、ADE20K 分割、零样本分类及计数等跨任务与跨模型的泛化。LookThere 超越了现有最先进的选择方法,为专用且高效的自适应计算提供了通用可扩展框架。