开发者自制 Apple Silicon 推理引擎,注意力显存砍掉 128 倍

Accomplished_Row1433 · reddit · 2026-09-20

作者开源了实验性 LLM 推理运行时 PagedServe,针对 Apple Silicon 上的 KV-cache 碎片化问题:采用固定大小物理 KV 块、逻辑到物理块表、逐块 attention + online softmax、写时复制前缀共享、连续批处理和实验性 Metal decode kernel。

实测结果:

美中不足:Metal kernel 目前比 PyTorch 逐块路径慢 2.43 倍,profile 显示瓶颈在 Python 每次调度都重建 Metal buffer 和编码 command buffer,而非 attention 计算本身。作者开源了完整运行时、基准和 283 个测试,并征集 persistent Metal buffer 与 command buffer 复用方面的优化建议。

仓库:github.com/vermasarthak/pagedserve

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →