SGLang 在 B300 上跑出 500+ tok/s

mchiang0610 · x · 2026-07-15

这条转发围绕 SGLang + GLM-5.2 + NVIDIA B300 的服务优化展开,重点不是模型发布本身,而是推理/服务栈如何把前沿开源模型跑得更快、更稳。

引用内容给出的关键信息包括:

帖子还提到 GLM-5.2 采用了 IndexShare、更强的 MTP head 等架构设计,并强调“全开源栈”在 agentic coding 场景下更快、更稳定、更可靠。

所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →