INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning
提出 INSPIRE 方法,采用“先内化后改进”策略提升大语言模型的示例驱动数学推理能力。该方法结合参考引导学生内化(RGSI)与分阶段评分偏好训练,将学习分解为方法导向和正确性导向两个阶段。实验在多个模型规模和家族中验证了该方法的一致性改进效果,其表现超越部分较大开源模型;且在分布外基准测试中确认未损害通用数学推理能力。