智迹闻AuraTracer
EN

EVENT DOSSIER

从样本结果到能力分布:重新思考LLM路由的监督机制

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

针对现有大语言模型路由方法因单次采样响应具有随机性而导致能力估计不稳定的问题,研究者提出了分布感知路由监督(DARS)新方法。该方法通过语义保持的查询重写与多次随机解码观测,估算查询级的模型能力分布,并汇总期望质量、成本及性能波动以构建风险感知监督,且不改变下游路由架构。跨多种任务与路由方法的实验表明,DARS 相比单次采样监督提升了路由效用并优化了成本 - 质量权衡。进一步分析显示,该优势在中等采样预算和不同解码温度下依然有效。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
DARS

信号强度SIGNALS

关键词热度
  • DARS1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

From Sampled Outcomes to Capability Distributions: Rethinking Supervision for LLM Routing

现有大语言模型路由方法常基于单次采样响应构建监督,因生成具有随机性导致能力估计不稳定。为此,研究者提出分布感知路由监督(DARS),通过语义保持的查询重写与多次随机解码观测来估算查询级模型能力分布。该方法汇总期望质量、成本及性能波动以构建风险感知监督,且不改变下游路由架构。跨多种任务与路由方法的实验表明,DARS 相比单次采样监督提升了路由效用并优化了成本 - 质量权衡。进一步分析显示,其优势在中等采样预算和不同解码温度下依然有效。