摘要由 AI 生成
研究人员提出一种无需训练即可在细粒度混合专家(MoE)模型中减半激活专家数量的方法。该方法通过引入无参数整数 $k_2$,将推理时的专家数量从 8 个降至 4 个。在 Qwen3.6-35B-A3B 模型上测试显示,此操作使 MMLU 得分下降仅 0.35 分,同时将路由专家的计算量减半;若完全移除归一化则会导致灾难性后果。该结果已在规模扩大 11 倍的 Qwen3.5-397B-A17B 模型上成功复现。分析表明,保留合适的参考质量至关重要,且 perplexity 与下游准确率倾向于不同的 $k_2$ 值,专家身份的重要性远高于权重,平衡及领域专用路由限制了专家剪枝空间。
关键实体KEY ENTITIES
Qwen3.5-397B-A17BQwen3.6-35B-A3B
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Qwen3.6-35B-A3B1
- Qwen3.5-397B-A17B1
全部报道(1)SOURCES
↗
研究提出一种无需训练即可减半激活专家的方法,通过引入一个无参数整数 $k_2$ 将推理时的专家数量从 8 降至 4。在 Qwen3.6-35B-A3B 模型上,该方法使 MMLU 得分下降仅 0.35 分,同时将路由专家计算量减半;若完全移除归一化则导致灾难性后果。该结果在更大的 Qwen3.5-397B-A17B 模型(规模扩大 11 倍)上同样复现有效。分析表明,保留合适的参考质量至关重要,且 perplexity 与下游准确率倾向于不同的 $k_2$ 值,专家身份的重要性远高于权重,平衡及领域专用路由限制了专家剪枝空间。