智迹闻AuraTracer
EN

EVENT DOSSIER

在细粒度专家混合模型中实现无需训练的激活专家减半

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

研究人员提出一种无需训练即可在细粒度混合专家(MoE)模型中减半激活专家数量的方法。该方法通过引入无参数整数 $k_2$,将推理时的专家数量从 8 个降至 4 个。在 Qwen3.6-35B-A3B 模型上测试显示,此操作使 MMLU 得分下降仅 0.35 分,同时将路由专家的计算量减半;若完全移除归一化则会导致灾难性后果。该结果已在规模扩大 11 倍的 Qwen3.5-397B-A17B 模型上成功复现。分析表明,保留合适的参考质量至关重要,且 perplexity 与下游准确率倾向于不同的 $k_2$ 值,专家身份的重要性远高于权重,平衡及领域专用路由限制了专家剪枝空间。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Qwen3.5-397B-A17BQwen3.6-35B-A3B

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Qwen3.5-397B-A17B × Qwe…1

信号强度SIGNALS

关键词热度
  • Qwen3.6-35B-A3B1
  • Qwen3.5-397B-A17B1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models

研究提出一种无需训练即可减半激活专家的方法,通过引入一个无参数整数 $k_2$ 将推理时的专家数量从 8 降至 4。在 Qwen3.6-35B-A3B 模型上,该方法使 MMLU 得分下降仅 0.35 分,同时将路由专家计算量减半;若完全移除归一化则导致灾难性后果。该结果在更大的 Qwen3.5-397B-A17B 模型(规模扩大 11 倍)上同样复现有效。分析表明,保留合适的参考质量至关重要,且 perplexity 与下游准确率倾向于不同的 $k_2$ 值,专家身份的重要性远高于权重,平衡及领域专用路由限制了专家剪枝空间。