From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data
大型语言模型产生流畅但事实错误的输出,一项新研究将自我注意力、最大似然预训练目标及自回归承诺视为幻觉产生的三个候选组件。研究者提出仅需采样访问即可执行归因程序,并验证了五个可证伪预测。直接预注册测试显示,在分歧点替换正确续写可将下游失败声明减少 46.7 个百分点(p<10^-9),但错误事实替换以同等统计速率减少错误,且模型在孤立情况下仅对 2.2% 的替换成功项回答正确。数据集病理放大了各组件作用,支持不对称依赖主张:组件是数据诱导失败所必需的中介,但数据缺陷并非组件诱导失败的必要条件。