智迹闻AuraTracer
EN

EVENT DOSSIER

“所选对象能否传达给读者?对基于语境的语言模型管道中的身份传递进行审计”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

一项针对 grounded language-model pipelines 的审计研究分析了 600 个 HybridQA 问题中的身份交接情况。在 1,463 条可解析记录中,结合精确键值查找和标题匹配的混合检索策略能 100% 找回目标对象;而仅依赖正文的 BM25 检索导致 26.6% 的记录遗漏对象,混合检索加重排序虽能改善但仍有 1.0% 的遗漏。研究发现,选定对象与数据集追踪 passage 身份的差异导致了 329 条记录的不一致,基于原始问题排名前五的检查在 5.9% 的记录中结果不符。冻结读者对比实验表明,对齐对象的缺失使精确匹配分数从 28.6 分显著下降至 31.0 分;移除特定 passage 会大幅降低精确匹配率,而移除长度相似的对比 passage 则无法复现此下降。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
HybridQA

信号强度SIGNALS

关键词热度
  • HybridQA1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Does the Selected Object Reach the Reader? Auditing Identity Handoffs in Grounded Language-Model Pipelines

本研究审计了 600 个 HybridQA 问题中 grounded language-model pipelines 的身份交接情况。在 1,463 条可解析记录中,精确键值查找和精确标题匹配能 100% 找回目标对象;而仅使用正文的 BM25 检索在 389 条记录(26.6%)上遗漏该对象,混合检索加重排序仅在 14 条(1.0%)上遗漏。由于选定对象与数据集追踪 passage 身份不同导致 329 条记录出现差异,基于原始问题排名的前五名检查在 106 条(5.9%)记录中结果不一致。冻结读者对比显示,对齐对象的缺失使精确匹配分数降低 28.6 至 31.0 分;在一个精心挑选的 64 项队列中,移除该 passage 会显著降低精确匹配率,而移除长度相似的对比 passage 则无法复现此下降。研…