llama.cpp 新 PR 将共享专家融合进 MMVQ,MoE 推理提速

jacek2023 · reddit · 2026-10-03

开发者 am17an 向 ggml-org/llama.cpp 提交 Pull Request #29184,将 MoE 模型中的共享专家(shared experts)融合进 MMVQ 量化路径,以加快 MoE 架构的推理速度。作者指出该优化并非对所有 MoE 模型通用,目前主要对 Qwen 35B A3B 这类包含共享专家的架构生效。对在本地部署量化 MoE 模型的用户来说是一个值得关注的性能改进。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →