When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models
金融大语言模型在报告摘要任务中因数值幻觉面临显著风险。本研究对比了三种变体:基础指令微调模型、领域适应模型(FT-A)及增强数值能力的领域模型(FT-A+B+C),引入三级可检测性分类法,发现领域微调在所有层级均严重削弱数值约束能力。基础模型幻觉率仅为 5.4%,而 FT-A 高达 82.5%(显式幻觉),FT-A+B+C 达 98%(隐性幻觉)。与直觉相反,数值监督加剧了所有层级的幻觉。研究将模板注入(即无论输入内容如何均插入记忆中的标准值)确认为微调模型的主要幻觉机制,并指出该现象源于领域适应导致的数值约束退化而非推理能力不足。建议评估协议涵盖所有可检测层级,部署实践需包含基于 grounding 的生成或放弃机制。