智迹闻AuraTracer
EN

EVENT DOSSIER

当财务微调失败时:域适应语言模型中数值幻觉的三级可检测性分析

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

一项针对金融领域大语言模型的研究指出,在报告摘要任务中,数值幻觉风险显著增加。研究对比了基础指令微调模型、领域适应模型(FT-A)及增强版(FT-A+B+C),发现无论采用何种微调策略,数值约束能力均严重退化。基础模型的幻觉率仅为 5.4%,而经过领域适配的 FT-A 模型显式幻觉率高达 82.5%,增强后的 FT-A+B+C 模型隐性幻觉率更是达到 98%。研究证实,数值监督反而加剧了所有层级的幻觉现象,其核心机制被确认为“模板注入”,即模型在生成时强制插入记忆中的标准值,而非因推理能力不足导致。该现象源于领域适应过程导致的数值约束退化。为此,研究者建议评估协议应涵盖所有可检测层级,并在实际部署中引入基于 grounding 的生成或放弃机制以规避风险。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

When Financial Fine-tuning Fails: A Three-Level Detectability Analysis of Numerical Hallucination in Domain-Adapted Language Models

金融大语言模型在报告摘要任务中因数值幻觉面临显著风险。本研究对比了三种变体:基础指令微调模型、领域适应模型(FT-A)及增强数值能力的领域模型(FT-A+B+C),引入三级可检测性分类法,发现领域微调在所有层级均严重削弱数值约束能力。基础模型幻觉率仅为 5.4%,而 FT-A 高达 82.5%(显式幻觉),FT-A+B+C 达 98%(隐性幻觉)。与直觉相反,数值监督加剧了所有层级的幻觉。研究将模板注入(即无论输入内容如何均插入记忆中的标准值)确认为微调模型的主要幻觉机制,并指出该现象源于领域适应导致的数值约束退化而非推理能力不足。建议评估协议涵盖所有可检测层级,部署实践需包含基于 grounding 的生成或放弃机制。