智迹闻AuraTracer
EN

EVENT DOSSIER

用于推理稀疏MOE模型的提议架构,通过分层和线性衰减来增加活跃参数。无需任何模型训练或微调即可实现简洁的推理。[p]

2026-09-07 02:41 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

用户 Specific-Tax-6700 在 llama.cpp 中实现了针对稀疏混合专家(MoE)模型的专家扩展功能。该方案允许运行时路由的专家数量超过原生 top-K 限制(如将 8 扩展为 x),采用分层加线性衰减机制,设置自适应阈值及从 99% 至 50% 的影响力衰减范围,并限定层范围。此功能支持所有后端,无需模型训练或微调即可实现精简推理。相关测试已在 Qwen 3.6 35B A4B+ 模型上完成,具体实现位于 GitHub 仓库 moe-expansion 分支。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Qwen 3.6llama.cpp

事件框架EVENT FRAME

产品发布

llama.cpp MoE expert expansion 支持稀疏 MoE 推理扩展

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Qwen 3.6 × llama.cpp1

信号强度SIGNALS

关键词热度
  • llama.cpp1
  • Qwen 3.61

全部报道(1)SOURCES

R r/MachineLearning en 2026-09-07 02:41

用于推理稀疏MOE模型的建议架构,通过分层和线性衰减来增加活跃参数。无需任何模型训练或微调即可实现简洁的推理。[p]

用户 Specific-Tax-6700 在 llama.cpp 中实现了 MoE 专家扩展功能,支持运行路由专家数量多于原生 top-K(8 变 x)的稀疏 MoE 模型。该方案采用分层加线性衰减机制,设置自适应阈值及 99% 至 50% 的影响力衰减范围,并限定层范围。此功能为运行时仅依赖、适用于所有后端,无需模型训练或微调即可实现精简推理。已在 Qwen 3.6 35B A4B+ 模型上完成测试,相关文档位于 GitHub 仓库 moe-expansion 分支。