智迹闻AuraTracer
EN

EVENT DOSSIER

“大型语言模型中语言准确性和内部置信度的偏差”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

一项针对 30 个来自三个模型家族的 LLM 的研究发现,语言置信度与内部置信度经常发生分歧。在分类任务中,两者在关联、幅度一致性和校准三个维度上均存在显著差异;生成任务中,语言置信度未能有效追踪基于语义熵的不确定性。指令微调模型常报告更高置信度且关联更强,但伴随更大的置信度差距和更差的校准效果。态度提示词虽能提升置信度但不改善对齐,而分数范例若避免置信值坍缩则能保留排序信号。回归分析表明,置信度分数的分布属性解释了大部分对齐模式,模型元数据在控制后作用较小。研究支持语言置信度为“有损通道”的观点,即其分散的分布虽携带有用排序信息,但无法实现校准,因此下游可靠性管道在使用前需通过多轴诊断评估语言置信度。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

When Linguistic and Internal Confidence Diverge in Large Language Models

一项针对 30 个来自三个模型家族、涵盖 8 个分类任务和 2 个生成任务的 LLM 研究,发现语言置信度与内部置信度经常发生分歧。在分类任务中,语言置信度与基于 logits 的置信度在关联、幅度一致性和校准三个维度上均存在显著差异;生成任务中,语言置信度未能有效追踪基于语义熵的不确定性。指令微调模型常报告更高置信度且关联更强,但伴随更大的置信度差距和更差的校准效果。态度提示词会提升置信度但不改善对齐,而分数范例若避免置信值坍缩则能保留排序信号。回归分析表明,置信度分数的分布属性解释了大部分对齐模式,模型元数据在控制后作用较小。这些结果支持语言置信度为“有损通道”的观点:分散的语言置信度分布虽携带有用排序信息,但无法实现校准。因此,下游可靠性管道在使用前需通过多轴诊断评估语言置信度。