A Verifier-Guided Explainable Reasoning Framework with Gold-Anchored QLoRA, Task-Aware Mixture-of-Experts, and Group-Relative RLVR
研究人员提出了一种结合金锚定 QLoRA、任务感知混合专家及组相对 RLVR 的验证器引导可解释推理框架,用于透明教育问答。该框架利用场加权 QLoRA 监督适配 Qwen2.5-3B-Instruct,并通过轻量级路由将逻辑问题分配给 FOL/Z3 验证器,物理问题分配给公式与单位感知的符号求解器。在 438 个未参与训练的示例上测试显示,RLVR 使 P3(推理深度与可解释性)从 50.68% 提升至 72.20%,而混合 P1(答案正确率)稳定在 55.94%;自一致性仅提升 P1 至 50.23%,符号验证贡献了其余混合增益。结果表明,RLVR 主要强化显式推理结构,符号验证则通过系统级保守修正补充神经策略并提高答案可靠性。