智迹闻AuraTracer
EN

EVENT DOSSIER

Don’t Drop Dropout:优化层稀疏性以实现高效的LLM训练与推理

2026-09-07 12:00 科学 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
5个提及
摘要由 AI 生成

最新研究表明,大语言模型(LLM)中的层丢弃(Layer dropout)性能下降主要源于配置不当而非技术本身局限。通过优化超参数缩放因子、整块丢弃粒度、增加层分布及减少时间调度等关键要素,在同等训练浮点运算量下,该策略能显著降低验证损失;或在保持相同验证精度的前提下,节省高达 25% 的训练计算资源。此外,优化后的层丢弃技术有效支持早退、中间层跳过和自我投机解码等推理优化手段,实现最高 1.5 倍的推理加速且精度损失可忽略不计。相关结论已在涵盖 2.71 亿至 82 亿参数模型及大规模数据集的超过 2400 次实验中得到验证,所有预训练实验均在 Cerebras CS-3 系统上完成。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
CS-3CerebrasHugging FaceMostafa ElhoushiarXiv

事件框架EVENT FRAME

行业动态

政府 · 科研机构跨 1 天

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
CS-3 × Cerebras1CS-3 × arXiv1Cerebras × arXiv1Cerebras × Hugging Face1Cerebras × Mostafa Elho…1Hugging Face × Mostafa …1

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    Don't Drop Dropout: Optimizing Layer Sp…

    本研究提出在状态最先进的大语言模型(LLM)训练中应使用层丢弃(Layer dropout)。实验表明,在优化层分布、时间调度及优化器超参数的情况下,相同训练浮点运算量(FLOPs)下层丢弃能降低损失值;对于给定训练步数,模型可达成更低或…

    2 条报道

信号强度SIGNALS

关键词热度
  • Cerebras2
  • arXiv1
  • CS-31
  • Hugging Face1
  • Mostafa Elhoushi1

全部报道(2)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

《论文页面 – 不要放弃:优化层稀疏性以实现高效的LLM训练与推理》

该研究证明层丢弃(stochastic depth)性能下降源于配置不当,而非其本身局限。通过优化配方,层丢弃可在同等训练 FLOPs 下降低验证损失,或为相同验证损失节省高达 25% 的 FLOP。实验在 271M 至 8.2B 参数模型及 160B 令牌规模上验证了四个关键要素:超参数缩放因子 1/(1−p)、整块丢弃粒度、增加层分布(ILD)以及减少时间调度(DTS)。更大模型可承受更高最大丢弃率,收益随规模增长。此外,该技术支持无需成本的推理深度弹性,实现早期退出与中间层跳过,带来最高 1.5 倍推理加速且精度损失可忽略不计。所有实验均在 Cerebras CS-3 系统上运行。

A arXiv cs.AI en 2026-09-07 12:00

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

本研究提出在状态最先进的大语言模型(LLM)训练中应使用层丢弃(Layer dropout)。实验表明,在优化层分布、时间调度及优化器超参数的情况下,相同训练浮点运算量(FLOPs)下层丢弃能降低损失值;对于给定训练步数,模型可达成更低或相似的验证损失同时节省高达 25% 的训练 FLOPs。此外,层丢弃支持早退、中间层跳过和自我投机解码等后训练优化,带来最高 1.5 倍的推理加速且精度损失可忽略不计。该研究基于超过 2400 次实验(涵盖 2.71 亿至 82 亿参数模型及最多 1600 亿 token 数据集)验证了结论在大规模训练中的可靠性,所有预训练实验均在 Cerebras CS-3 系统上运行。