ATSInfer 优化本地大模型推理速度
新提出的 ATSInfer 系统专为消费级设备设计,通过混合 CPU-GPU 调度优化大模型推理。该技术扩展了 llama.cpp,针对层内张量异质性进行细粒度调度,使 24G 显存运行百亿参数大模型的解码速度提升约 3 倍,有效突破了本地显存瓶颈。
2026-07-19 ~ 2026-07-20 · 2 条相关
- ATSInfer优化llama.cpp:24G显存跑百亿大模型解码提速3倍 — TeksEdge · 2026-07-19
- 消费级设备上的张量级推理调度 — pmttyji · 2026-07-20