摘要
报道态势
全部报道(1)
摘要由 AI 生成
研究人员提出一种名为 BMT(Bridging Modalities and Tasks)的统一分层视觉 Transformer(ViT)框架,旨在同时解决合成孔径雷达(SAR)图像到光学图像的翻译及语义分割任务。该框架通过共享层级视觉 Transformer 联合优化上述两项任务,集成了局部 ViT 块、增强输出模块、控制网式条件注入机制以及有界肯德尔不确定性加权方案。实验评估在 WHU-OPT-SAR 配对数据集以及基于 HRSID 和 DIOR 构建的无对偶船只数据集上进行,结果显示该方法在图像翻译质量与分割性能方面表现具有竞争力。目前,相关数据集与源代码已公开。
关键实体KEY ENTITIES
Bridging Modalities and Tasks ControlNet DIOR HRSID LocalViTBlock WHU-OPT-SAR
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
Bridging Modalities and… 1 Bridging Modalities and… 1 Bridging Modalities and… 1 Bridging Modalities and… 1 Bridging Modalities and… 1 ControlNet × DIOR 1
信号强度SIGNALS
关键词热度
Bridging Modalities and Tasks 1
LocalViTBlock 1
ControlNet 1
WHU-OPT-SAR 1
HRSID 1
DIOR 1
全部报道(1)SOURCES
全部
中文
英文
最新发布
最早发布
↗
提出一种名为 BMT 的统一分层 ViT 框架,通过共享层级视觉 Transformer 联合优化 SAR 到光学图像翻译与语义分割任务。该框架集成局部 ViT 块、增强输出模块、控制网式条件注入机制及有界肯德尔不确定性加权方案,在 WHU-OPT-SAR 配对数据集及基于 HRSID 和 DIOR 构建的无对偶船只数据集上评估。实验表明该方法在翻译质量与分割性能上表现具有竞争力,相关数据集与源代码已公开。