摘要由 AI 生成
用户 Specific-Tax-6700 在 llama.cpp 中实现了针对稀疏混合专家(MoE)模型的专家扩展功能。该方案允许运行时路由的专家数量超过原生 top-K 限制(如将 8 扩展为 x),采用分层加线性衰减机制,设置自适应阈值及从 99% 至 50% 的影响力衰减范围,并限定层范围。此功能支持所有后端,无需模型训练或微调即可实现精简推理。相关测试已在 Qwen 3.6 35B A4B+ 模型上完成,具体实现位于 GitHub 仓库 moe-expansion 分支。
关键实体KEY ENTITIES
Qwen 3.6llama.cpp
事件框架EVENT FRAME
产品发布
llama.cpp
MoE expert expansion
支持稀疏 MoE 推理扩展
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
用户 Specific-Tax-6700 在 llama.cpp 中实现了 MoE 专家扩展功能,支持运行路由专家数量多于原生 top-K(8 变 x)的稀疏 MoE 模型。该方案采用分层加线性衰减机制,设置自适应阈值及 99% 至 50% 的影响力衰减范围,并限定层范围。此功能为运行时仅依赖、适用于所有后端,无需模型训练或微调即可实现精简推理。已在 Qwen 3.6 35B A4B+ 模型上完成测试,相关文档位于 GitHub 仓库 moe-expansion 分支。