摘要由 AI 生成
一项针对大型语言模型代码修复能力的研究指出,包括 GPT-5.5 在内的前沿模型存在过度编辑倾向,即重写超出修复 Bug 所需的最小范围。研究人员基于 400 个 BigCodeBench 问题构建评估框架,通过注入受控 AST 级污染生成已知最小补丁进行测试,发现模型常伴随不必要的编辑和认知复杂度增加。研究团队引入保存指令后,将平均超额 Levenshtein 距离从 0.195 降至 0.131,降低了 26.6% 的认知复杂度,同时将 Pass@1 评分提升 2.3 分。对比不同优化策略发现,监督微调易导致过拟合,而强化学习在编辑保真度与性能保留的权衡上表现最佳。
关键实体KEY ENTITIES
GPT-5.5Min-Yen KanTongyao ZhuWei Hern Lim
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Tongyao Zhu1
- Wei Hern Lim1
- Min-Yen Kan1
- GPT-5.51
全部报道(1)SOURCES
↗
大型语言模型在修复代码时存在过度编辑倾向,即重写超出修复 Bug 所需的最小范围。研究团队基于 400 个 BigCodeBench 问题构建评估框架,通过注入受控 AST 级污染生成已知最小补丁,发现包括 GPT-5.5 在内的前沿模型常伴随不必要的编辑和认知复杂度增加。引入保存指令可将平均超额 Levenshtein 距离从 0.195 降至 0.131,降低认知复杂度 26.6% 并将 Pass@1 提升 2.3 分;监督微调易过拟合,而强化学习在编辑保真度与性能保留的权衡上表现最佳。