From Tokens to Semantics: Leveraging Complementary Signals for Hallucination Detection in Black-Box LLMs
本研究针对黑盒大语言模型(LLM)中幻觉检测问题,提出利用语义熵与基于 Token 的不确定性两种互补信号。研究扩展了 TopK 方法以聚合采样响应中的 Token 级信号,评估了结合目标响应不确定性与语义差异的混合 CoCoA 方法,并提出了 Gated 和 Stacked 两种监督学习方法。在涵盖五个公开基准(含多模态手写支票提取)及两个自建基准(金融摘要与长文本问答)的七项测试中,使用四种语言模型进行验证。结果显示,Stacked 方法在约半数情况下表现最佳;TopK 和 CoCoA 在无监督标签下仍具竞争力但需精细校准阈值。研究进一步评估了不同假阳性率预算(1% 至 15%)下的性能、生成与校准选择的影响以及数据集特征的差异,证实不存在普遍最优的方法。