ATSInfer 优化本地大模型推理速度

新提出的 ATSInfer 系统专为消费级设备设计,通过混合 CPU-GPU 调度优化大模型推理。该技术扩展了 llama.cpp,针对层内张量异质性进行细粒度调度,使 24G 显存运行百亿参数大模型的解码速度提升约 3 倍,有效突破了本地显存瓶颈。

2026-07-19 ~ 2026-07-20 · 2 条相关