摘要由 AI 生成
研究人员开发了跨模态分诊网络(CMTN),一种融合图像与文本的多模态深度学习框架,旨在对胸部 X 光片进行基于严重程度的分诊、病理检测及可视化解释。该网络结合 Swin Transformer V2 视觉编码器与 PubMedBERT 文本编码器,在 MIMIC-CXR-JPG 数据集上训练,针对四级严重度分诊和 14 种常见病理进行了优化。定量基准测试显示,CMTN 在严重度分诊上的加权 Kappa 系数为 0.9341,宏观 AUROC 达 0.9970,处理延迟仅为 34 毫秒,显著优于 BioViL 基线模型。然而,盲测临床审计发现,该模型与真实放射科医生判断的一致性显著降低(加权 Kappa 系数为 0.1399),且仅有 54.3% 的热图达到可接受的定位标准。
关键实体KEY ENTITIES
BioViLCMTNMIMIC-CXR-JPGPubMedBERTSwin Transformer V2
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- CMTN1
- Swin Transformer V21
- PubMedBERT1
- MIMIC-CXR-JPG1
- BioViL1
全部报道(1)SOURCES
↗
研究人员开发了跨模态分诊网络(CMTN),一种融合图像与文本的多模态深度学习框架,用于胸部 X 光片的分级分诊、病理检测及可视化解释。该网络采用 Swin Transformer V2 视觉编码器与 PubMedBERT 文本编码器结合门控交叉注意力机制,在 MIMIC-CXR-JPG 数据集(34,639 对图文数据)上训练,针对四级严重度分诊和 14 种病理进行优化。定量基准测试显示,CMTN 在严重度分诊上的加权 Kappa 系数为 0.9341,宏观 AUROC 达 0.9970,延迟为 34 毫秒,优于 BioViL 基线模型。然而,盲测临床审计发现,与真实放射科医生判断的一致性显著降低(加权 Kappa 系数为 0.1399),仅 54.3% 的热图达到可接受的定位标准。研究结论指出,仅针对 NL…