Jenga 让 LLM 推理显存利用率最高提升 79.6%
AccBalanced · x · 2026-08-04
Jenga 是一个面向异构 LLM 推理服务的内存管理框架,目标是把 GPU 显存用得更满、推理成本压得更低。
- 论文指出,现代 LLM 在 embedding 尺寸、attention 结构和访问模式上越来越异构,传统内存分配方式容易产生碎片和缓存失配。
- Jenga 采用 两级分配器,并用 LCM(最小公倍数)式的尺寸策略来减少碎片,同时提供按层定义缓存与淘汰逻辑的接口。
- 作者把它实现到 vLLM 上,实验显示 GPU 内存利用率最高可提升 79.6%,核心收益是提升 batch size、降低异构模型混部时的推理成本。
「Infra」频道最新
- 有人指出 token 价格自 5 月底起持续下跌 — GaryMarcus · 2026-08-04
- MiniMax H3 开放权重并支持 15 秒 2K 视频生成 — petrusenko_max · 2026-08-04
- Qwen 3.8 Max 上线 Vercel AI Gateway,成本低且安全榜中游 — evilrabbit_ · 2026-08-04
- 50 人本地 RAG 怎么配:OCR、向量检索和重排 — InternationalGap3698 · 2026-08-04
- BlackRock 为 Meta 背书数据中心完成 125 亿美元债务融资 — Beth_Kindig · 2026-08-04
- Gartner 6.37 万亿美元 IT 预算下,2027 企业 AI 规划已过时 — sanjaykalra · 2026-08-04