开发者给 llama.cpp 移植 MoE 专家扩展:运行时激活超原生 top-K 专家

Specific-Tax-6700 · reddit · 2026-09-07

开发者提出一种无训练、无微调的稀疏 MoE 推理架构,并将其移植到 llama.cpp:让 MoE 模型在运行时激活比原生 top-K 更多的路由专家(如 8→x),配合自适应阈值、99→50% 影响力线性衰减和层级范围控制,目标是提升有效激活参数量、获得更简洁的推理表现。

该方案为纯运行时改动,支持所有后端。作者在 Qwen 3.6 35B A4B+ 上做了测试,文档与代码已在 GitHub 的 moe-expansion 分支公开。

所属事件:开发者自制 llama.cpp 分支,为 MoE 模型实现专家扩展(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →