消费级设备上的张量级推理调度

pmttyji · reddit · 2026-07-20

这篇论文提出 ATSInfer,一种面向消费级设备的混合 CPU-GPU 推理系统。作者指出,现有离载/卸载方案多停留在层级或专家级调度,无法细致处理同一层内部不同张量的异质性,也难以适应设备负载变化。 ATSInfer 采用**张量粒度**离载,结合静态张量放置、负载感知的动态传输,以及异步 CPU-GPU 协调,在笔记本/桌面平台上更高效地分配存储、数据移动和计算。 论文实验显示: - prefill 吞吐最高提升 **1.94×** - decode 吞吐最高提升 **3.29×** - 同时提高了 GPU 利用率,并更充分利用 PCIe 带宽 作者结论是,这种设计能显著改善个人设备上本地 LLM 部署的体验。

所属事件:ATSInfer 优化本地大模型推理速度(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →