智迹闻AuraTracer
EN

EVENT DOSSIER

从推理中估算不确定性:关于大语言模型多语言及跨语言MCQA性能的大规模研究

2026-09-07 12:00 大模型 🔥 40.2 事件热度
1家信源
1天持续发酵
40.2事件热度
1个提及
摘要由 AI 生成

一项针对大型语言模型(LLMs)的多语言和跨语言多项选择题(MCQA)性能的大规模研究,旨在从推理过程中估算模型的不确定性。该研究通过广泛的数据集和实验,分析了不同语言背景下模型在推理任务中的表现差异及不确定性特征,为提升大模型的可靠性与可解释性提供了实证依据。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
LLMs

信号强度SIGNALS

关键词热度
  • LLMs1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs

研究人员对 22 种语言中的多语种及跨语言多选择问答(MCQA)任务进行了大规模不确定性估计(UE)评估,涵盖高、中、低资源设置。研究使用两个人工筛选的问答数据集,对比了九种开放和封闭盒子 UE 方法在不同模型规模与架构下的表现,并采用长文本推理方式以消除 LLM 作为裁判及基于嵌入评分带来的噪声。主要发现包括:提示模型用英语进行推理而保留低资源语言问题能显著提升 UE 性能,表明低资源语言的阅读理解能力完好,可靠性瓶颈在于生成而非理解;用英语进行推理能有效缩小低资源与高资源语言间的 UE 性能差距,证明生成语言比问题语言更重要;UE 方法的选择应取决于模型规模,小模型中基于概率的开放盒子方法表现更优,大模型中封闭盒子自陈述不确定性方法更优越。此外,研究提供了选择性预测中的阈值选择分析,为多语种环境下的弃权校…