智迹闻AuraTracer
EN

EVENT DOSSIER

FailSAE:利用稀疏自编码器实现视觉语言模型的可解释性故障预测

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员提出 FailSAE 框架,利用稀疏自编码器(SAEs)解决视觉语言模型的故障预测问题。该方法将故障预测定义为对 SAE 潜在激活的分类任务,并引入三阶段故障感知训练流程,旨在增强潜在方向的可解释性与信息量。实验表明,该框架在性能上优于现有基线方法。分析显示,故障感知训练使 SAE 潜在方向能捕捉更多类别特定概念,同时揭示了模型在故障期间从类别特定概念向模糊或风格相关概念转变的表示变化。此外,研究还探讨了所学 SAE 潜在方向对运行时故障恢复的支持作用。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
CLIP

信号强度SIGNALS

关键词热度
  • CLIP1

全部报道(1)SOURCES

A arXiv cs.CV en 2026-09-07 12:00

FailSAE:利用稀疏自编码器实现视觉语言模型的可解释性故障预测

本文提出 FailSAE 框架,利用稀疏自编码器(SAEs)实现视觉语言模型的可解释故障预测。该方法将故障预测定义为对稀疏 SAE 潜在激活的分类任务,并引入三阶段故障感知训练流程,旨在使学习到的潜在方向在保持可解释性的同时增强故障预测信息量。实验表明,该框架在故障预测性能上优于现有基线方法。进一步分析显示,故障感知训练促使 SAE 潜在方向捕捉更多类别特定概念;同时揭示了模型表示在故障期间从类别特定概念向模糊或风格相关概念的转变。此外,研究探讨了所学 SAE 潜在方向对运行时故障恢复的支持作用。