4 张 V100 跑满 Qwen3.8-Flash-Next 256K 上下文,实测数据出炉
Primary_Exchange21 · reddit · 2026-08-30
社区项目 SGLang-V100 宣布支持 RadixArk/Qwen3.8-Flash-Next-NVFP4,在 4 张 V100 32GB 上跑满全上下文,>50GB ngram 卸载到系统内存,prefill 稳定在约 4000 tok/s,decode 全程约 60 tok/s 直至 256K 上下文末尾。
作者给出详尽基准数据:
- 不同 prompt 长度(10k–250k):TTFT 从约 2.1 秒线性增长到约 63 秒,ITL 基本稳定在 16.7–17.7ms;开 MTP 后 ITL 常降至 12–16ms,输出速度在部分长度段提升到 60–82 tok/s
- 并发测试(1–16):并发 1 时 MTP 带来 +35.7% 输出提升(55→75 tok/s);并发 4/8 时 +9%12%;并发 16 时 MTP 反而 -23%,MTP 接受长度约 3.0–3.4
项目地址:github.com/haohervchb/sglang-V100
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01