An Integrated Vision-and-Language Pretraining (VLP) and Visual Question Answering (VQA) model to Automate Nondestructive Evaluation Image Analysis
引入名为 ChatNDE Figure to Caption 的 AI 方法,旨在利用深度学习和自然语言处理自动化无损检测(NDE)图像分析。该系统结合 ResNet50 提取图像特征与 GPT2 生成自然文本,并集成视觉问答(VQA)模型以回答如“是否存在裂纹”等具体问题。研究构建了大型 NDE 数据集,通过 BLEU 分数评估模型输出与专家描述的匹配度。尽管当前模型准确率较低,但生成的简短 caption 已能涵盖人类专家关注的图像关键特征。该方案有助于加速 NDE 工作流程、减少人为错误并提升技术可及性。