摘要由 AI 生成
FAVE 提出一种轻量级可变分辨率 Vision Transformer(ViT),在保留原生几何结构的同时,以高清晰度编码外部选定的局部区域。该方法在 ImageNet 96 像素小物体检测任务中,相比固定分辨率 ViT 将 Top-1 准确率提升 9.4 个点,同时计算量降低 12.7 倍。随后,FAVE 作为互补局部分支被集成至 FastVLM 模型中,仅增加最多 16 个局部令牌,便实现了显著的性能与效率优化:在 TextVQA 任务中得分提升 1.60 点,推理首字延迟(TTFT)较 SmolVLM2-2.2B 快 3.3 倍;在 GQA 属性问答问题上,FastVLM-1.5B 模型性能提升 1.31 点。
关键实体KEY ENTITIES
FAVEFastVLMSmolVLM2-2.2BTextVQAViT
事件框架EVENT FRAME
产品发布
FAVE
FAVE
提出轻量级可变分辨率视觉编码器
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- FAVE1
- ViT1
- FastVLM1
- TextVQA1
- SmolVLM2-2.2B1
全部报道(1)SOURCES
↗
FAVE 提出一种轻量级可变分辨率 ViT,在保留原生几何结构的同时以高清晰度编码外部选定区域。该方法在 ImageNet 96 像素小物体上,相比固定分辨率 ViT 将 Top-1 准确率提升 9.4 个点,且计算量降低 12.7 倍。随后 FAVE 作为互补局部分支集成至 FastVLM,仅增加最多 16 个局部令牌,使 TextVQA 得分提升 1.60 点,TTFT 速度较 SmolVLM2-2.2B 快 3.3 倍;在 GQA 属性问题上,FastVLM-1.5B 性能提升 1.31 点。