SGLang 深度适配 DeepSeek V4.1 Flash,24 小时内冲到 873 tok/s
BanghuaZ · x · 2026-09-12
SGLang 团队宣布在 DeepSeek V4.1 Flash 发布后提供 Day 0 支持,并在 24 小时内把推理性能推到 4×GB300 上 BS=1 时 873 tok/s。
- 优化手段包括 FP8 GEMM 快速路径、kernel fusion 与 overlap、DSpark 优化、MoE TP4
- V4.1 Flash 引入多项架构变化:因果式 encoder-decoder 设计、CSA2 共享 KV、Engram、mHC、DSpark,SGLang 全部首日适配
- 团队发布了逐步可复现的工程优化指南
- DeepGEMM、FlashMLA 等更多优化仍在路上
所属事件:SGLang 24 小时适配 DeepSeek V4.1 Flash 达 873 tok/s(2 条相关)→
「Infra」频道最新
- AI infra 争论焦点从 GPU 转向 CPU:Agent 把瓶颈推向编排层 — AccBalanced · 2026-09-12
- Yutori 浏览器 agent 单任务成本 1.46 美元,不到前沿模型 1/10 — DhruvBatra_ · 2026-09-12
- 编译器自动推导 FlashAttention:含 SMEM 与 Tensor Core 分配 — vtabbott_ · 2026-09-12
- 算力决定 AI 进度:若十年前爆发,现有硬件红利将一次性兑现 — cis_female · 2026-09-12
- DeepSeek v4.1 Flash 发布首日即适配 vLLM,覆盖六款 NVIDIA GPU — woosuk_k · 2026-09-12
- 开源 Plano:两行配置实现按意图自动路由 LLM 省 50% 账单 — Roger_M_Taylor · 2026-09-12