Unified Deployment-Aware Evaluation of Open Reasoning Language Models
研究人员提出统一评估框架,对七种开源推理语言模型配置在四个基准测试上进行零样本、思维链及少样本提示的完整对比。该研究涵盖 ARC-Challenge、GSM8K、MATH 1-3 级及 TruthfulQA MC1 共 238 个示例的 84 种条件组合,累计评估 19,992 个样本。除准确率外,报告了 Wilson 置信区间、延迟、峰值 VRAM、加权综合性能、帕累托有效运行点、提示敏感性及兼容性诊断等指标。Gemma-4-26B-A4B 在零样本提示下获得最高加权分 0.794;Gemma-4-E4B 在各提示设置中保持接近顶尖水平,同时具备更低的延迟和内存占用。分析显示领先配置间差异显著,部署权衡至关重要,且提示策略改变模型排名而非整体偏移。基准特异性互补性为路由预留空间,任务感知选择器加权分达 0.…