From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing
现有大语言模型路由方法常基于单次采样响应构建监督,因生成具有随机性导致能力估计不稳定。为此,研究者提出分布感知路由监督(DARS),通过语义保持的查询重写与多次随机解码观测来估算查询级模型能力分布。该方法汇总期望质量、成本及性能波动以构建风险感知监督,且不改变下游路由架构。跨多种任务与路由方法的实验表明,DARS 相比单次采样监督提升了路由效用并优化了成本 - 质量权衡。进一步分析显示,其优势在中等采样预算和不同解码温度下依然有效。