摘要由 AI 生成
针对大模型长时过训练场景,研究对比了矩阵预条件方法(Muon、SOAP)与动量调度方法(ADANA)。实验覆盖 51M 至 253M 参数模型及 1x 至 256x 过训练因子。结果显示,随着训练时长增加,最优学习率调度可能反转,最佳权重衰减系数约按平方根缩放,且长时训练通常偏好固定内存策略。ADANA 在调整 AdamW 固定内存后初期落后于 Muon 和 SOAP,但随着训练进行,其日志时间权重衰减与动量冷却带来的收益持续累积,最终在最高过训练因子下超越 Muon 并与 SOAP 竞争,以接近理论预测的指数优势大幅领先 AdamW。
关键实体KEY ENTITIES
ADANAAdamWMuonSOAP
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- ADANA1
- AdamW1
- Muon1
- SOAP1
全部报道(1)SOURCES
↗
研究团队发现优化器性能与最优超参数随训练时长显著变化。对比矩阵预条件方法(Muon、SOAP)及动量调度方法(ADANA)在 51M 至 253M 参数模型及 1x 至 256x 过训练因子下的表现,结果显示:首选学习率调度可能随过训练轴反转,最佳权重衰减系数约按 sqrt(OT) 缩放,长训练时长通常偏好长固定内存。ADANA 在调整 AdamW 固定内存后仍保持优势,其日志时间权重衰减与动量冷却带来的收益随训练增加而累积;经此处理,ADANA 以接近 DANA 理论预测的指数优势超越 AdamW。Muon 和 SOAP 在大部分测量范围内提供恒定的 token 效率优势,但 ADANA 初期落后于两者后差距缩小,并在最高过训练因子下超越 Muon 并与 SOAP 竞争。这些结果确立了训练时长作为优化器评估…