消费级设备上的张量级推理调度
pmttyji · reddit · 2026-07-20
这篇论文提出 ATSInfer,一种面向消费级设备的混合 CPU-GPU 推理系统。作者指出,现有离载/卸载方案多停留在层级或专家级调度,无法细致处理同一层内部不同张量的异质性,也难以适应设备负载变化。 ATSInfer 采用**张量粒度**离载,结合静态张量放置、负载感知的动态传输,以及异步 CPU-GPU 协调,在笔记本/桌面平台上更高效地分配存储、数据移动和计算。 论文实验显示: - prefill 吞吐最高提升 **1.94×** - decode 吞吐最高提升 **3.29×** - 同时提高了 GPU 利用率,并更充分利用 PCIe 带宽 作者结论是,这种设计能显著改善个人设备上本地 LLM 部署的体验。
所属事件:ATSInfer 优化本地大模型推理速度(2 条相关)→
「Infra」频道最新
- 高通预览端侧 GGUF 运行工具GenieX — carrycooldude · 2026-07-20
- DwarfStar 让 Ada 卡盒变推理服务器 — antirez · 2026-07-20
- DwarfStar 新增多项推理优化 — antirez · 2026-07-20
- BMS 在 Vera Rubin 上建 AI 工厂 — nordicinst · 2026-07-20
- Hut 8 签下98亿美元AI租约 — sunychoudhary · 2026-07-20
- 中国开源模型重塑AI经济学 — Stratechery · 2026-07-20