开发者自制 llama.cpp 分支,为 MoE 模型实现专家扩展
一位开发者借助 GLM 4.5/5.3 Flash 为 llama.cpp 写出自定义分支,将一种无训练、无微调的稀疏 MoE 推理架构移植其中:让模型在运行时激活比原生 top-K 更多的路由专家(如 8→x),并配合自适应阈值。目前该实现仅在部分模型上验证,但为本地推理的 MoE 灵活性提供了新思路。
2026-09-07 ~ 2026-09-07 · 2 条相关
- 开发者自制 llama.cpp 分支,让 MoE 模型支持专家数量扩展 — Specific-Tax-6700 · 2026-09-07
- 开发者给 llama.cpp 移植 MoE 专家扩展:运行时激活超原生 top-K 专家 — Specific-Tax-6700 · 2026-09-07