开发者自制 llama.cpp 分支,为 MoE 模型实现专家扩展

一位开发者借助 GLM 4.5/5.3 Flash 为 llama.cpp 写出自定义分支,将一种无训练、无微调的稀疏 MoE 推理架构移植其中:让模型在运行时激活比原生 top-K 更多的路由专家(如 8→x),并配合自适应阈值。目前该实现仅在部分模型上验证,但为本地推理的 MoE 灵活性提供了新思路。

2026-09-07 ~ 2026-09-07 · 2 条相关