有人把 SGLang 改到 4 张 V100 上跑 Qwen
Primary_Exchange21 · reddit · 2026-07-27
有人把 SGLang 改到能在 V100 上跑 Qwen 和 Laguna
这条帖子分享了一个面向老卡 V100 的 SGLang 分支,作者做了一串非常工程化的推理栈改造:
- 为 V100 写了 TeilLang FlashAttention;
- 使用开源 marlin-v100;
- 给 sm70 打通了未加限制的 FlashInfer;
- 让 DFlash 能跑 Qwen3.5 / Qwen3.6;
- 还加入了 Laguna S2.1 支持。
作者说他们也尝试让 DFlash 跑 Laguna,但暂时没有成功。按照其 4×V100 32GB NVLink 的测试,Qwen 场景下大约能跑到 4000–6000 pp、约 100 tokens/s。
帖子同时给出了仓库、TileLang FA、Marlin-V100 链接,并提到已经提供 Docker 镜像,减少从头编译的时间成本。
「编程与Agent」频道最新
- Rust 小项目让旧工作重建快 4.67 倍、少用 94% token — rudrank · 2026-07-27
- AgentPond 增加 Supabase 支持,把 traces 留在应用里 — MarcusSchiesser · 2026-07-27
- 修好 chat template 后,这个视觉 agent 环境恢复推理 — mervenoyann · 2026-07-27
- 免费工作坊聚焦开源 AI 工具的安全审计与运维应用 — Al_Grigor · 2026-07-27
- 解析 Hugging Face 商业模式,实测 Kimi K3 自动剪辑视频 — NielsRogge · 2026-07-27
- Stopful 推出旅行 MCP 服务器,把 agent 行程变成可编辑地图 — AffectionateGain3245 · 2026-07-27