智迹闻AuraTracer
EN

EVENT DOSSIER

“在概括之前进行通道化:将理解视为一种动态探测方式”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 发布了题为《Canalization Before Generalization: Grokking as a Dynamical Probe》的论文。该研究针对过参数神经网络中的"Grokking"现象(即训练拟合与未见样本表现分离),对三个任务施加了短时固定时长的权重衰减(WD)扰动,以测量其对后期泛化时间的影响。研究发现,在预泛化平台期早期,这些影响表现为无序状态;随后则形成稳定的剂量排序:更强的 WD 增加导致更早的泛化,而更弱的 WD 增加则导致更晚的泛化。这种有序性在所有三个任务中均早于可见泛化出现。此外,当测试损失屏障在扰动与基线泛化检查点间坍缩至零时,上述时间效应依然持续存在。作者借用 Waddington 的发育景观类比,将这种日益受限的解选择与持续…

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Canalization Before Generalization: Grokking as a Dynamical Probe

arXiv:2608.25813v2 发布论文《Canalization Before Generalization: Grokking as a Dynamical Probe》,研究过参数神经网络中训练拟合与未见样本表现分离的"Grokking"现象。研究人员对三个 Grokking 任务施加短时固定时长权重衰减(WD)扰动,测量其对后期泛化时间的影响。结果显示,在预泛化平台期早期这些影响无序,但随后形成稳定的剂量排序:更强的 WD 增加导致更早泛化,更弱的 WD 增加导致更晚泛化。该有序性在所有三个任务中均早于可见泛化出现,且测试损失屏障在扰动与基线泛化检查点间坍缩至零的同时,这种时间效应依然持续。作者借用 Waddington 的发育景观类比,将这种日益受限的解选择与持续的剂量排序泛化时间变化称为"G…