智迹闻AuraTracer
EN

EVENT DOSSIER

“更好的理解,更好的修复?基于大语言模型的自动程序修复中幻觉现象的研究”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

针对大语言模型(LLMs)在自动化程序修复(APR)中的表现,一项新研究分析了 832 个 Defects4J 漏洞的修复过程。结果显示,现有评估方法缺乏对修复过程中幻觉现象的深入洞察。研究发现,在 812 个样本修复中,高达 72.7% 存在修复幻觉,主要错误类型包括错误因果定位(占 45.9%)和错误修复策略(占 18.5%)。此外,模型常误判触发测试用例、预测涉及分支控制流的行覆盖率或生成缺失触发条件的额外测试用例。最终评估表明,仅有 21.0% 至 55.9% 的生成补丁能够通过开发者编写的测试套件。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Better Understanding, Better Fixes? A Study of Hallucination in LLM-based Automated Program Repair

一项针对大语言模型(LLMs)自动化程序修复(APR)中幻觉现象的多层分析研究指出,现有评估缺乏对修复过程中幻觉的深入洞察。研究人员通过触发测试用例识别、行覆盖率预测和额外测试用例生成三项任务,考察了最终补丁中的修复幻觉及中间产物中的理解幻觉。在对 832 个 Defects4J 漏洞进行的自动评估与人工分析显示,仅 21.0%-55.9% 的生成补丁能通过开发者编写的测试套件;在 812 个样本修复中,72.7% 存在修复幻觉,其中错误因果定位和错误修复策略分别占 45.9% 和 18.5%,且模型常误判触发测试用例、预测涉及分支控制流的行覆盖率或生成缺失触发条件的额外测试用例。