MedProb:探索用于医疗问答的视觉语言模型的内部表征机制
MedProb 是一个轻量级探测框架,能在不微调模型的情况下从冻结的视觉 - 语言模型(VLM)表示中预测多选择医疗视觉问答(Med-VQA)答案。在 PATH-VQA、SLAKE 和 VQA-RAD 数据集上,MedProb 比提示方法恢复了更多与答案相关的信号,表现优于医疗 VLM 和智能体系统。该研究还发现,与提示相比,探测缩小了小型模型与大模型之间的差距;在 14 对通用与医疗 VLM 的匹配测试中,医疗适配并未一致提升线性可解码性。此外,自由文本生成存在高达 10 个百分点的答案位置偏差,而 MedProb 虽也存在该偏差但受影响方式不同。主要结果针对多选择/多分类 Med-VQA 设置,并展示了探测可通过拒绝采样评分扩展至开放式生成。