When Linguistic and Internal Confidence Diverge in Large Language Models
一项针对 30 个来自三个模型家族、涵盖 8 个分类任务和 2 个生成任务的 LLM 研究,发现语言置信度与内部置信度经常发生分歧。在分类任务中,语言置信度与基于 logits 的置信度在关联、幅度一致性和校准三个维度上均存在显著差异;生成任务中,语言置信度未能有效追踪基于语义熵的不确定性。指令微调模型常报告更高置信度且关联更强,但伴随更大的置信度差距和更差的校准效果。态度提示词会提升置信度但不改善对齐,而分数范例若避免置信值坍缩则能保留排序信号。回归分析表明,置信度分数的分布属性解释了大部分对齐模式,模型元数据在控制后作用较小。这些结果支持语言置信度为“有损通道”的观点:分散的语言置信度分布虽携带有用排序信息,但无法实现校准。因此,下游可靠性管道在使用前需通过多轴诊断评估语言置信度。