开发者自制 Apple Silicon 推理引擎,注意力显存砍掉 128 倍
Accomplished_Row1433 · reddit · 2026-09-20
作者开源了实验性 LLM 推理运行时 PagedServe,针对 Apple Silicon 上的 KV-cache 碎片化问题:采用固定大小物理 KV 块、逻辑到物理块表、逐块 attention + online softmax、写时复制前缀共享、连续批处理和实验性 Metal decode kernel。
实测结果:
- 2048 token 上下文下,临时 attention 内存从基线 12,288 KB/层降到 96 KB/层(128 倍);
- M3 Pro 上 TinyLlama 吞吐从 3.78 tok/s 提升到 13.2 tok/s。
美中不足:Metal kernel 目前比 PyTorch 逐块路径慢 2.43 倍,profile 显示瓶颈在 Python 每次调度都重建 Metal buffer 和编码 command buffer,而非 attention 计算本身。作者开源了完整运行时、基准和 283 个测试,并征集 persistent Metal buffer 与 command buffer 复用方面的优化建议。
仓库:github.com/vermasarthak/pagedserve
「编程与Agent」频道最新
- Da7em Bench 发布:每模型 200 个真实客户任务、12 领域评 AI 实战力 — airesearch12 · 2026-09-20
- 用 Codex 做室内挂画排版:Blender 里 3D 重建免重算锚点 — perilli · 2026-09-20
- AI 工程师日常都在干什么?RAG、可观测性与后端初探 — tech_kie · 2026-09-20
- 一条 Queue 生成整部广播剧:开源本地多模型流水线发布 — fflluuxxuuss · 2026-09-20
- 开源计算机 Agent OpenClaw 已揽 39 万 GitHub 星,附 8 个开源 Agent 工具盘点 — Aiden_Tech_Ai · 2026-09-20
- 把 Agent 花费分为 Capex 与 Opex:别让 AI 反复解决同一个问题 — njyx · 2026-09-20