ATSInfer优化llama.cpp:24G显存跑百亿大模型解码提速3倍

TeksEdge · x · 2026-07-19

介绍了一种名为 ATSInfer 的新技术,该技术通过扩展 llama.cpp,大幅提升了超出显存(VRAM)容量的大模型在本地运行时的推理速度。 - **核心机制**:不同于传统将整个网络层或 MoE 专家粗暴放置在 GPU 或 CPU 上的做法,ATSInfer 深入到张量级别进行细粒度调度。它会评估每个张量在 CPU 和 GPU 上的性能表现,将性价比最高的张量保留在显存中,并动态调整计算与 PCIe 传输的重叠。 - **实测性能**:在相同的显存预算下对比原版 llama.cpp,预fill速度最高提升 1.94 倍,整体解码速度最高提升 3.29 倍(在 RTX 4090 上提升 3.12 倍),GPU SM 利用率平均提升约 70%。 - **测试硬件与模型**:在 RTX 3060 6GB 和 RTX 4090 24GB 系统上,成功高效运行了 Llama 3.1-70B、Qwen3.5-122B 等大模型。 - **本地部署意义**:这意味着通过更智能的软件调度,普通开发者可以利用廉价的系统内存配合有限的显存,跑起远超显存容量的超大模型。目前该研究暂未公开代码。

所属事件:ATSInfer 优化本地大模型推理速度(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →