Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines
本研究审计了 600 个 HybridQA 问题中 grounded language-model pipelines 的身份交接情况。在 1,463 条可解析记录中,精确键值查找和精确标题匹配能 100% 找回目标对象;而仅使用正文的 BM25 检索在 389 条记录(26.6%)上遗漏该对象,混合检索加重排序仅在 14 条(1.0%)上遗漏。由于选定对象与数据集追踪 passage 身份不同导致 329 条记录出现差异,基于原始问题排名的前五名检查在 106 条(5.9%)记录中结果不一致。冻结读者对比显示,对齐对象的缺失使精确匹配分数降低 28.6 至 31.0 分;在一个精心挑选的 64 项队列中,移除该 passage 会显著降低精确匹配率,而移除长度相似的对比 passage 则无法复现此下降。研…