Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference
提出一种缓存感知的后训练框架,联合适配 MoE 骨干网络与轻量级辅助缓存路由器,在保持推理时原生 Top-K 专家选择规则的同时优化显存效率。该框架包含仅更新模式的 Temporal Router 和加入空间路由器的全时空 Spatio-Temporal Router。研究人员在 Qwen3 和 GPT-OSS 模型上进行了 GSM8K、MATH 和 CommonsenseQA 三项任务评估,结果显示 Temporal Router 一致提升了缓存命中率并减少了专家权重传输量;Spatio-Temporal Router 在 Qwen3 的三项任务中实现了最佳负载调整效率,相比最强预取基线使调整后命中率提升 1.15 至 18.03 个百分点,流量降低 4.6% 至 53.3%。辅助组件消融实验表明联合后训练…