FailSAE:利用稀疏自编码器实现视觉语言模型的可解释性故障预测
本文提出 FailSAE 框架,利用稀疏自编码器(SAEs)实现视觉语言模型的可解释故障预测。该方法将故障预测定义为对稀疏 SAE 潜在激活的分类任务,并引入三阶段故障感知训练流程,旨在使学习到的潜在方向在保持可解释性的同时增强故障预测信息量。实验表明,该框架在故障预测性能上优于现有基线方法。进一步分析显示,故障感知训练促使 SAE 潜在方向捕捉更多类别特定概念;同时揭示了模型表示在故障期间从类别特定概念向模糊或风格相关概念的转变。此外,研究探讨了所学 SAE 潜在方向对运行时故障恢复的支持作用。