投机预取MoE专家:参考llama.cpp PR #25294

carrigmat · x · 2026-08-27

线程给出具体优化提示:让代码 agent 参考 llama.cpp 的 PR #25294,通过把当前层的激活传入下一层的 router 来投机性预取专家权重,实现计算与加载的重叠。

所属事件:六千美元纯CPU方案本地全量跑前沿万亿模型(14 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →