智迹闻AuraTracer
EN

EVENT DOSSIER

从架构到成果:大型语言模型中幻觉的结构起源以及数据的放大作用

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

一项发表于 2026 年 9 月的研究指出,大型语言模型的幻觉现象(即生成流畅但事实错误的输出)主要由自我注意力机制、最大似然预训练目标及自回归承诺三个架构组件共同导致。该研究提出仅需采样访问即可执行归因程序,并验证了五个可证伪预测。直接预注册测试表明,在分歧点替换正确续写可将下游失败声明减少 46.7 个百分点(p<10^-9),而错误事实替换以同等统计速率减少错误。此外,模型在孤立情况下仅对 2.2% 的替换成功项回答正确。研究还发现数据集病理放大了各组件的作用,支持了不对称依赖主张:架构组件是数据诱导失败所必需的中介,但数据缺陷并非组件诱导失败的必要条件。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data

大型语言模型产生流畅但事实错误的输出,一项新研究将自我注意力、最大似然预训练目标及自回归承诺视为幻觉产生的三个候选组件。研究者提出仅需采样访问即可执行归因程序,并验证了五个可证伪预测。直接预注册测试显示,在分歧点替换正确续写可将下游失败声明减少 46.7 个百分点(p<10^-9),但错误事实替换以同等统计速率减少错误,且模型在孤立情况下仅对 2.2% 的替换成功项回答正确。数据集病理放大了各组件作用,支持不对称依赖主张:组件是数据诱导失败所必需的中介,但数据缺陷并非组件诱导失败的必要条件。