MTP 预取 MoE 专家提速实测
zyxciss · reddit · 2026-07-17
作者在 qwen3.6 35b a3b 的 CPU/GPU offload 场景里,尝试用模型自带的 MTP head 先预测下一 token,再根据该 token 可能会命中的专家路由,提前在后台预取对应 experts,从而把 PCIe 传输延迟藏到当前 token 计算过程中。
他在 llama.cpp 上做了初步埋点,结果显示:
- 直接用“上一个 token 用过的 expert”做预取,命中率只有 20.7%,几乎没用。
- 用 MTP 引导的预测后,top-8 命中率 78%,top-16 命中率 90%,但 K 越大带宽开销也越高。
- 观察到明显的 hot expert 长尾:前 64 个 expert(总共 256 个)覆盖了 51% 的全部使用量。
- 当前基线大约 35–36 tok/s,如果全部专家都在 VRAM,理论上可到 200 tok/s,说明瓶颈主要在 PCIe 传输而不是算力。
作者想确认这个思路是否真能落地:是否已有类似实现、router-only forward 的开销会不会抵消收益、以及在更大 batch 下是否会失效。他表示自己暂时不打算重写引擎,更倾向于 fork llama.cpp。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11