MTP 预取 MoE 专家提速实测

zyxciss · reddit · 2026-07-17

作者在 qwen3.6 35b a3b 的 CPU/GPU offload 场景里,尝试用模型自带的 MTP head 先预测下一 token,再根据该 token 可能会命中的专家路由,提前在后台预取对应 experts,从而把 PCIe 传输延迟藏到当前 token 计算过程中。

他在 llama.cpp 上做了初步埋点,结果显示:

作者想确认这个思路是否真能落地:是否已有类似实现、router-only forward 的开销会不会抵消收益、以及在更大 batch 下是否会失效。他表示自己暂时不打算重写引擎,更倾向于 fork llama.cpp。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →