FreeToken 按实测带宽调度整机,单张工作站 GPU 跑 753B 模型

FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution

Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu, Ion Stoica

cs.DC

2026-08-17

把整机当统一推理平台,按实测带宽把 MoE 专家缺缓存放行给 PCIe 或 CPU 原地计算;8GB 笔记本跑 35B,单卡跑 753B。

这篇在解决什么

开源权重模型的获取门槛降下来了,运行门槛没有。DeepSeek-V4-Flash 总参数 284B,单个 token 只激活 13B,但完整专家池在 FP4 下约 140GB,消费级显卡装不下,现有本地引擎只能把大部分专家放在主机内存里按需搬运。llama.cpp、Ollama、KTransformers 各自解决了一角,剩下的坑论文拆成三个:预fill时长上下文里全部 token 的路由并集几乎覆盖每层所有专家,140GB 权重反复过 PCIe,PCIe 5.0 x16 一次约 2 秒,笔记本的 x8 链路要 10 秒以上;decode 阶段专家缓存未命中要么搬要么 CPU 算,怎么分工没有原则性策略,静态放置跟不上逐 token 变化的路由;边缘机器的显存随时被浏览器和游戏挤占,预算在整个会话期都在变。作者是 Berkeley 与 UT Austin 的系统团队(Song Han、Matei Zaharia、Ion Stoica 均在列),核心立场:把整机当成统一推理平台来调度,而非把消费级 GPU 当成缩小版数据中心 GPU。

方法

骨架是两级专家内存:完整专家池常驻主机内存,非专家权重常驻 GPU,剩余显存做成所有 MoE 层共享的弹性专家缓存,槽位按(层,专家)逻辑标识管理。三个机制叠在上面:

执行层全部塞进 CUDA Graph:路由去重、命中分类、q 推导、LRU 受害者选择在一个 GPU kernel 完成,CPU 分支连同同步节点一起被图捕获,避免每层主机同步。显存预算变化时在调度器安全点重建缓存,不重启引擎;权重用 FTW 格式预先归并成运行时布局,加载直接进最终位置再 pin,省掉先清零后覆盖的开销。

结果

配置指标结果
RTX 5090,Qwen3.6-35B-A3B解码吞吐77–83 tok/s,最强基线的 1.8–2.3×
RTX 5090,DeepSeek-V4-Flash 284B解码吞吐22–25 tok/s,1.5–1.9×
RTX PRO 6000,GLM-5.2 753B解码吞吐14.9 tok/s(llama.cpp 为 7.3)
8GB RTX 4060 笔记本跑 35B解码吞吐39.3 tok/s,超过 Codex 生产轨迹中位 33
全工作负载最差 TTFT尾延迟低于 44 s;各基线在 179–946 s 间越线

agent 负载下的稳定性是主要卖点:解码速率相对单轮 setting 最多降 12%,KTransformers 在第一个 agent 负载就掉了 31%。归因实验补上机制证据:同等缓存容量下,FreeToken 全局 LRU 的专家未命中率 16%/39%(两个模型),KTransformers 预fill期定的放置为 41%/59%,llama.cpp 静态切分 62%/89%;去掉双缓冲,16k token 预fill 吞吐掉 26%;跨五台消费级机器领先最强基线 1.3–2.1×。

为什么重要

对想本地跑前沿开源模型的人,这篇挪动的是「什么机器能跑什么模型」的边界:8GB 笔记本交互式跑 35B,单张 96GB 工作站卡跑 753B,且 753B 那档对比是在位相同的专家权重下做的,赢在调度而非量化。q 这种按实测带宽分工的闭式解,对任何 CPU-GPU 混合推理都直接可借。系统已开源(flashml.ai),支持 20 多个 MoE 模型,四类真实 agent 工作负载(含 Claude Code 原生协议)都验证过。

局限与存疑

完整专家池必须装进主机内存:GLM-5.2 的 433GB checkpoint 意味着这个档位只属于配备工作站级 RAM 的机器(论文那台是 512GB),普通台式机无缘。租用的 3090/4090/5090 服务器把 CPU 限到 6 线程来模拟消费级主机,是模拟而非全真机,虽然两台真机的实测带宽落在同一量级做了背书。评估是单流单用户视角,没有多请求并发吞吐的对比;基线是否都调到各自最优,论文没有逐一论证,MoE-Infinity 只跑通了单轮负载。CPU 分支依赖 pinned memory 与 DMA 注册,系统不满足时退化为纯 CPU MoE 后端,峰值带宽打折。

术语

原文与代码

社区讨论

相关论文

全部论文解读