开发者给 llama.cpp 移植 MoE 专家扩展:运行时激活超原生 top-K 专家
Specific-Tax-6700 · reddit · 2026-09-07
开发者提出一种无训练、无微调的稀疏 MoE 推理架构,并将其移植到 llama.cpp:让 MoE 模型在运行时激活比原生 top-K 更多的路由专家(如 8→x),配合自适应阈值、99→50% 影响力线性衰减和层级范围控制,目标是提升有效激活参数量、获得更简洁的推理表现。
该方案为纯运行时改动,支持所有后端。作者在 Qwen 3.6 35B A4B+ 上做了测试,文档与代码已在 GitHub 的 moe-expansion 分支公开。
所属事件:开发者自制 llama.cpp 分支,为 MoE 模型实现专家扩展(2 条相关)→
「Infra」频道最新
- 黄仁勋官宣 GPT-6 Astra:用 10 万颗 Grace Blackwell 训练,称 AGI 已至 — himanshustwts · 2026-09-07
- Wan2GP 上架 Pinokio:6GB 显存一键跑 AI 视频生成 — cocktailpeanut · 2026-09-07
- Wan2GP AMD 版上架 Pinokio:RDNA2 起全系支持 — cocktailpeanut · 2026-09-07
- 晒一屋子硬件跑 OpenClaw,作者自嘲又造了一波 rage bait — HankYeomans · 2026-09-07
- 谷歌称高性能内存已占 AI 服务器物料成本 75% 以上 — Beth_Kindig · 2026-09-07
- 双 5090 本地跑多模型全自动产出产品演示视频,34 期零人工剪辑 — Ok_Cartographer_6086 · 2026-09-07