智迹闻AuraTracer
EN

EVENT DOSSIER

一种基于Gold-Anchored QLoRA、任务感知的专家混合模型以及群体相对RLVR的可解释推理框架

2026-09-07 12:00 大模型 跨 2 天 🔥 47.2 事件热度
2家信源
2天持续发酵
47.2事件热度
1个提及
摘要由 AI 生成

研究人员提出一种验证器引导的可解释推理框架,旨在提升透明教育问答的表现。该框架基于 Qwen2.5-3B-Instruct 模型,采用金锚定 QLoRA 进行监督适配,并结合任务感知的混合专家系统。通过轻量级路由机制,逻辑问题被分配给 FOL/Z3 验证器,物理问题则交由公式与单位感知的符号求解器处理。在包含 438 个未参与训练示例的测试中,引入组相对 RLVR(Reasoning with Language and Verification)后,推理深度与可解释性指标 P3 从 50.68% 显著提升至 72.20%,而答案正确率混合指标 P1 稳定在 55.94%。结果显示,RLVR 有效强化了显式推理结构,符号验证则通过系统级修正补充了神经策略的可靠性,其效果优于仅依赖自一致性的方法。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Qwen2.5-3B-Instruct

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    A Verifier-Guided Explainable Reasoning…

    研究人员提出了一种结合金锚定 QLoRA、任务感知混合专家及组相对 RLVR 的验证器引导可解释推理框架,用于透明教育问答。该框架利用场加权 QLoRA 监督适配 Qwen2.5-3B-Instruct,并通过轻量级路由将逻辑问题分配给 …

  2. 2026-09-07

    A Verifier-Guided Explainable Reasoning…

    研究人员提出了一种结合金锚定 QLoRA、任务感知混合专家及组相对 RLVR 的验证器引导可解释推理框架,用于透明教育问答。该框架利用场加权 QLoRA 监督将 Qwen2.5-3B-Instruct 适配至权威答案,并通过轻量级路由将逻…

信号强度SIGNALS

关键词热度
  • Qwen2.5-3B-Instruct2

全部报道(2)SOURCES

A arXiv cs.LG en 2026-09-04 22:52

A Verifier-Guided Explainable Reasoning Framework with Gold-Anchored QLoRA, Task-Aware Mixture-of-Experts, and Group-Relative RLVR

研究人员提出了一种结合金锚定 QLoRA、任务感知混合专家及组相对 RLVR 的验证器引导可解释推理框架,用于透明教育问答。该框架利用场加权 QLoRA 监督适配 Qwen2.5-3B-Instruct,并通过轻量级路由将逻辑问题分配给 FOL/Z3 验证器,物理问题分配给公式与单位感知的符号求解器。在 438 个未参与训练的示例上测试显示,RLVR 使 P3(推理深度与可解释性)从 50.68% 提升至 72.20%,而混合 P1(答案正确率)稳定在 55.94%;自一致性仅提升 P1 至 50.23%,符号验证贡献了其余混合增益。结果表明,RLVR 主要强化显式推理结构,符号验证则通过系统级保守修正补充神经策略并提高答案可靠性。

A arXiv cs.AI en 2026-09-07 12:00

A Verifier-Guided Explainable Reasoning Framework with Gold-Anchored QLoRA, Task-Aware Mixture-of-Experts, and Group-Relative RLVR

研究人员提出了一种结合金锚定 QLoRA、任务感知混合专家及组相对 RLVR 的验证器引导可解释推理框架,用于透明教育问答。该框架利用场加权 QLoRA 监督将 Qwen2.5-3B-Instruct 适配至权威答案,并通过轻量级路由将逻辑问题分配给 FOL/Z3 验证器、物理问题分配给公式与单位感知符号求解器。在 438 个保留示例测试中,RLVR 使 P3(推理深度与可解释性)从 50.68% 提升至 72.20%,混合 P1(答案正确率)稳定在 55.94%;自一致性仅提升 P1 至 50.23%,符号验证提供剩余增益。结果显示,RLVR 主要强化显式推理结构,而符号验证通过系统级修正补充神经策略以提升答案可靠性。