智迹闻AuraTracer
EN

EVENT DOSSIER

一种针对内存高效MoE推理的缓存感知联合路由器适配方案

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

研究人员提出一种缓存感知的后训练框架,用于优化混合专家(MoE)模型的推理显存效率。该框架联合适配 MoE 骨干网络与轻量级辅助缓存路由器,在保持原生 Top-K 专家选择规则的同时提升性能。实验包含两种路由机制:仅更新模式的 Temporal Router 和加入空间路由器的全时空 Spatio-Temporal Router。研究团队在 Qwen3 和 GPT-OSS 模型上进行了 GSM8K、MATH 和 CommonsenseQA 三项任务评估。结果显示,Temporal Router 一致提升了缓存命中率并减少了专家权重传输量;Spatio-Temporal Router 在 Qwen3 的三项任务中实现了最佳负载调整效率,相比最强预取基线使调整后命中率提升 1.15 至 18.03 个百分点,流量…

相关事件RELATED EVENTS
关键实体KEY ENTITIES
GPT-OSSQwen3

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
GPT-OSS × Qwen31

信号强度SIGNALS

关键词热度
  • Qwen31
  • GPT-OSS1

全部报道(1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference

提出一种缓存感知的后训练框架,联合适配 MoE 骨干网络与轻量级辅助缓存路由器,在保持推理时原生 Top-K 专家选择规则的同时优化显存效率。该框架包含仅更新模式的 Temporal Router 和加入空间路由器的全时空 Spatio-Temporal Router。研究人员在 Qwen3 和 GPT-OSS 模型上进行了 GSM8K、MATH 和 CommonsenseQA 三项任务评估,结果显示 Temporal Router 一致提升了缓存命中率并减少了专家权重传输量;Spatio-Temporal Router 在 Qwen3 的三项任务中实现了最佳负载调整效率,相比最强预取基线使调整后命中率提升 1.15 至 18.03 个百分点,流量降低 4.6% 至 53.3%。辅助组件消融实验表明联合后训练…