Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective
一项关于暂停令牌微调动态的研究提出 Masked Boundary Pause(MBP)规则,通过在推理步骤边界放置且损失掩码的暂停令牌来干预训练过程。该策略在 1B-8B Qwen 和 Llama 模型上测试,数学任务提升达 6 分,代码任务提升达 2.5 分,同时保持通用语言理解能力。实验表明,MBP 通过模式保留机制优化了训练动态:在合成持续学习任务中,掩码暂停令牌以匹配最终适应度时仅重写约 4 倍于前已学分布;在数学推理探测任务中,边界相邻令牌编码了更多下游步骤信息。此外,该模式保持策略将收益扩展至 GRPO,表明暂停令牌是训练动态干预而非仅推理时的计算工具。