Less Data, Faster Training: repeating smaller datasets speeds up learning via sampling biases
一项新研究提出,重复使用较小数据集可加速模型训练。该工作发现,在算法任务、架构及优化器上,重复少量样本比使用大样本能节省计算资源,且此现象无法用既有理论解释。研究认为,速度提升源于采样偏差带来的合适层间增长,该效应在小数据集下更为显著。作者提供了理论分析与多项干预的实证证据,表明在小数据稀缺时采用“小数据集加重复”不仅是被动策略,更可主动利用其作为优化中的有利归纳偏置,尤其在推理任务中效果明显。