智迹闻AuraTracer
EN

EVENT DOSSIER

跨模态分诊网络:一种基于严重程度的分诊和多模态深度学习框架,适用于胸部X光图像的分析

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

研究人员开发了跨模态分诊网络(CMTN),一种融合图像与文本的多模态深度学习框架,旨在对胸部 X 光片进行基于严重程度的分诊、病理检测及可视化解释。该网络结合 Swin Transformer V2 视觉编码器与 PubMedBERT 文本编码器,在 MIMIC-CXR-JPG 数据集上训练,针对四级严重度分诊和 14 种常见病理进行了优化。定量基准测试显示,CMTN 在严重度分诊上的加权 Kappa 系数为 0.9341,宏观 AUROC 达 0.9970,处理延迟仅为 34 毫秒,显著优于 BioViL 基线模型。然而,盲测临床审计发现,该模型与真实放射科医生判断的一致性显著降低(加权 Kappa 系数为 0.1399),且仅有 54.3% 的热图达到可接受的定位标准。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
BioViLCMTNMIMIC-CXR-JPGPubMedBERTSwin Transformer V2

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
BioViL × CMTN1BioViL × MIMIC-CXR-JPG1BioViL × PubMedBERT1BioViL × Swin Transform…1CMTN × MIMIC-CXR-JPG1CMTN × PubMedBERT1

信号强度SIGNALS

关键词热度
  • CMTN1
  • Swin Transformer V21
  • PubMedBERT1
  • MIMIC-CXR-JPG1
  • BioViL1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Cross-modal triage network: a multimodal deep learning framework for severity-based triage and visual explainability in chest radiographs

研究人员开发了跨模态分诊网络(CMTN),一种融合图像与文本的多模态深度学习框架,用于胸部 X 光片的分级分诊、病理检测及可视化解释。该网络采用 Swin Transformer V2 视觉编码器与 PubMedBERT 文本编码器结合门控交叉注意力机制,在 MIMIC-CXR-JPG 数据集(34,639 对图文数据)上训练,针对四级严重度分诊和 14 种病理进行优化。定量基准测试显示,CMTN 在严重度分诊上的加权 Kappa 系数为 0.9341,宏观 AUROC 达 0.9970,延迟为 34 毫秒,优于 BioViL 基线模型。然而,盲测临床审计发现,与真实放射科医生判断的一致性显著降低(加权 Kappa 系数为 0.1399),仅 54.3% 的热图达到可接受的定位标准。研究结论指出,仅针对 NL…