SGLang 携手三星发白皮书:同 GPU 延迟降 3.1 倍

ying11231 · x · 2026-09-15

SGLang 将亮相 AI Infra Summit(9 月 15 日,booth #729),并与三星半导体联合演讲,主题为突破 LLM 推理的 KV cache 瓶颈。双方已发布联合白皮书:SGLang HiCache + Samsung Cognos 通过可组合的 AI Memory Node™ 扩展 GPU 内存,在相同 GPU 硬件上实现最高 3.1 倍延迟降低与 2.2 倍吞吐提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →