llama.cpp 新 PR 将共享专家融合进 MMVQ,MoE 推理提速
jacek2023 · reddit · 2026-10-03
开发者 am17an 向 ggml-org/llama.cpp 提交 Pull Request #29184,将 MoE 模型中的共享专家(shared experts)融合进 MMVQ 量化路径,以加快 MoE 架构的推理速度。作者指出该优化并非对所有 MoE 模型通用,目前主要对 Qwen 35B A3B 这类包含共享专家的架构生效。对在本地部署量化 MoE 模型的用户来说是一个值得关注的性能改进。
「Infra」频道最新
- AI 能写 CUDA 内核了,内核工程师转向验证与硬件专长 — anneouyang · 2026-10-03
- 麒麟 K9050 能效超台积电 N3P 的 Tensor G6,工艺或已成熟 — pstAsiatech · 2026-10-03
- Supabase 融资 1.5 亿美元,估值达 106.5 亿美元,七成新库由 AI 创建 — ycombinator · 2026-10-03
- CoreWeave 大会发布 Forge:训练推理评测 Agent 开发一站打通 — WolframRvnwlf · 2026-10-03
- Epoch 估算全球算力可支撑数十亿 AI Agent,抵全人类工时 — teortaxesTex · 2026-10-03
- 清华与无问芯穹开源 RLark:百节点机器人集群云端调度平台 — jiqizhixin · 2026-10-03