摘要由 AI 生成
研究人员发现,在循环神经网络(GRU、LSTM)中使用粗粒度 4 位量化存储内部状态时,会导致“循环状态写回问题”,使网络基于陈旧记忆重复计算,严重破坏短期和长期参数估计精度。在时间分辨荧光寿命成像任务中,该问题导致关键参数误差分别增加约 70 倍和 300 倍。实验表明,单纯提高位宽或改变存储规则而未重新训练均无法根本解决;通过引入错误反馈、残差记忆及方向记忆等轻量级干预措施,可在不重新训练的情况下恢复大部分精度。此外,独立验证显示单元状态比对隐藏状态更敏感,确立了循环状态写回机制作为低精度循环动态的关键决定因素,并将状态存储接口确定为量化循环推理的核心设计考量。
关键实体KEY ENTITIES
GRUHugging FaceLSTM
事件框架EVENT FRAME
当前状态
提出循环状态写回机制以解决低精度量化导致的记忆失效问题,需引入错误反馈等干预措施并重新训练模型。
报道态势 · 每日报道量LANGUAGE SPLIT
整合时间线UNIFIED TIMELINE
-
2026-09-07
低精度量化引发记忆失效研究
研究人员发现 GRU/LSTM 使用 4 位量化存储内部状态会导致循环状态写回问题,使荧光寿命成像任务中关键参数误差分别增加约 70 倍和 300 倍。
2 条报道
信号强度SIGNALS
全部报道(2)SOURCES
↗
研究人员发现,在循环神经网络(GRU 和 LSTM)中,使用粗粒度 4 位量化存储内部状态会导致“循环状态写回问题”,使网络在数十步内基于陈旧记忆重复计算。在时间分辨荧光寿命成像任务中,仅改变存储规则而未重新训练模型,导致两个关键参数的估计误差分别增加约 70 倍和 300 倍。研究证实,修复的关键在于学习动态与存储规则的兼容性而非单纯增加位宽;携带舍入误差、保留残差或追踪重复次阈值更新方向等轻量级干预措施均能恢复大部分精度且无需重新训练。此外,独立训练的 LSTM 验证了单元状态对此问题比隐藏状态更敏感。
↗
研究人员提出“循环状态写回”机制以解决低精度量化在时序推理中破坏记忆的问题。在荧光寿命成像的 GRU 编码器 - 解码器中,将连续状态传播替换为确定性 4 位状态存储,导致短寿命和长寿命参数估计误差分别增加约 70 倍和 300 倍。当重复的小更新低于写入阈值时,存储状态近乎固定而网络继续提出变化,引发失败;通过错误反馈、残差记忆和方向记忆携带被抑制的更新信息可恢复精度且无需重新训练。实验表明,提高状态精度可能恶化固定循环解,而匹配训练显示可与状态接口兼容;在独立训练的 LSTM 中重复该干预也复现了失败与恢复现象,并揭示细胞状态比对隐藏状态更敏感。研究结果确立了循环状态写回作为低精度循环动态的关键决定因素,并将状态存储接口确定为量化循环推理的核心设计考量。