FailureSpot: Label-Efficient Timestamp-Level Failure Detection for Vision-Language-Action Models
针对视觉 - 语言 - 动作(VLA)模型在长程执行中不可预测的失败问题,研究者提出了一种基于标签效率的时间戳级失败检测框架。该方法利用未标记的 VLA 动作片段构建弱监督信号以捕捉异常模式,并通过主动学习筛选不确定性最高的轨迹进行时间戳级标注与微调。实验表明,该框架有效解决了传统方法因训练数据标注不匹配导致的噪声问题,显著提升了时间戳级及轨迹级的失败检测性能。