Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices
Yangyijian Liu, Hongyi Ye, Mingyang Li, Wu-jun Li
cs.DC, cs.AI, cs.LG
2026-07-11
ATSInfer 将 CPU-GPU 混合推理的调度粒度从层级精细到张量级,结合离线静态分配、运行时负载感知动态迁移和异步流水线,在消费级笔记本上解码吞吐量最高提升 3.29 倍、预填充吞吐量最高提升 1.94 倍。
在笔记本和台式机上本地运行大语言模型面临一个根本性的资源错配:量化后的模型权重往往仍超出消费级 GPU 的显存容量,必须借助 CPU 内存做卸载推理。现有混合 CPU-GPU 系统通常以「层」或「专家」为调度单位,将整个 Transformer 层或 MoE 专家组放在同一个后端。这种粗粒度调度有两个盲点:其一,同一层内不同张量的算子计算强度、访存模式差异显著,GPU 加速收益并不均匀;其二,消费设备的硬件负载会随浏览器、IDE、温度墙等因素动态变化,静态分配方案无法适应这种波动。
ATSInfer 的目标是:在有限显存预算下,把每个字节的 GPU 空间用在加速收益最高的张量上,同时在推理过程中根据当前硬件压力动态调整权重搬运决策。
ATSInfer 以 llama.cpp 为基础,增加约 1.5 万行 C++ 代码,围绕三个相互配合的机制展开。
静态张量放置:离线阶段对每个张量分别测量 CPU 和 GPU 的执行时延,定义「实测性能密度」(k = 时延 / 显存占用),以此衡量单位显存换来的加速收益。张量放置被形式化为一个背包式整数规划:在显存预算 M 的约束下,最大化 GPU 驻留张量的延迟收益之和,同时对相邻张量跨后端切换引入的激活传输开销施加惩罚。稠密模型用标准动态规划求解,MoE 模型则先将专家张量与非专家张量分组,再分别求解。
负载感知动态迁移:静态方案在推理开始后固定,但运行时硬件状态会变化。ATSInfer 在每轮 decode 前用最近若干步的实测数据更新 CPU 速度、GPU 速度、PCIe 带宽和计算-传输重叠窗口的估计,然后再次运行动态规划,决定哪些 CPU 驻留张量值得临时搬到 GPU 执行。关键洞察是:如果前序计算时间足够长,权重传输可以完全被隐藏在临界路径之外;只有「暴露传输时间」才真正增加延迟。重调度有阈值保护(偏差 <15% 或间隔 <5×TPOT 时复用旧方案),避免频繁重规划造成额外开销。
异步 CPU-GPU 协同:内存布局分为三个区域:GPU 常驻区、CPU 固定内存(pinned memory)和 GPU 临时缓冲区。执行时用两条 CUDA 流分离「计算流」和「传输流」,激活传输走 SM-driven 的 Zero-Copy 路径,权重传输走独立的 Copy Engine,两者共享 PCIe 带宽但互不阻塞,从而最大化流水线重叠。
在笔记本平台(Intel i7-11800H + RTX 3060 6GB)和桌面平台(Intel i7-11700 + RTX 4090 24GB)上,对 GLM-Z1-9B、Qwen3-14B、Qwen3-30B-A3B 等稠密与 MoE 模型进行评测,与 llama.cpp、vLLM、KTransformers 对比:
| 指标 | 结果 | 对比基线 |
| 预填充吞吐最高提升(笔记本) | 1.88x | vs llama.cpp |
| 预填充吞吐最高提升(桌面) | 1.94x | vs llama.cpp |
| 解码吞吐最高提升(笔记本) | 3.29x | vs llama.cpp |
| 解码吞吐最高提升(笔记本) | 4.35x | vs vLLM |
| decode GPU SM 利用率提升 | 70% | vs llama.cpp |
负载适应实验中,在 60% 外部 CPU 压力下 TPOT 劣化减少 13%,60% GPU+PCIe 压力下劣化减少 38%。消融实验表明:预填充收益主要来自静态张量放置和异步协同,解码收益主要来自异步协同和动态迁移。
本地部署大模型的用户体验长期受制于 CPU 瓶颈。ATSInfer 提供了一条无需改变模型、无需服务端资源的路径,通过更精细的调度在现有消费硬件上释放出接近三倍的解码速度。对于 MoE 模型,它与专家感知的缓存替换策略正交,未来可叠加使用。
论文还给出了形式化的优化框架:实测性能密度替代计算强度作为调度依据,动态规划统一建模执行成本、切换代价和传输重叠三者之间的权衡。这个框架为后续系统设计提供了明确的分析工具。
实验机型局限于两台 NVIDIA 平台(RTX 3060 / RTX 4090),对 AMD GPU、Apple Silicon 等异构设备的适用性未经验证。ATSInfer 目前未集成 MoE 专有的专家缓存替换机制,在专家激活模式高度集中的场景下,KTransformers 或 HybriMoE 的专家驻留策略可能仍有优势。TPOT 约 40 ms 而重建计算图需约 7 ms、重新规划需约 9 ms,重调度开销相对可观,在极短生成场景下触发频繁重调度的代价需进一步评估。静态分配依赖离线 profiling,新模型或新硬件首次运行会有额外启动开销。