有人把 SGLang 改到 4 张 V100 上跑 Qwen

Primary_Exchange21 · reddit · 2026-07-27

有人把 SGLang 改到能在 V100 上跑 Qwen 和 Laguna

这条帖子分享了一个面向老卡 V100 的 SGLang 分支,作者做了一串非常工程化的推理栈改造:

作者说他们也尝试让 DFlash 跑 Laguna,但暂时没有成功。按照其 4×V100 32GB NVLink 的测试,Qwen 场景下大约能跑到 4000–6000 pp、约 100 tokens/s。

帖子同时给出了仓库、TileLang FA、Marlin-V100 链接,并提到已经提供 Docker 镜像,减少从头编译的时间成本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →