SGLang 更新 Qwen3.8-27B 配方,RTX 5090 跑出 206 tok/s
ying11231 · x · 2026-08-18
SGLang 宣布更新 Qwen3.8-27B 在 RTX 5090 和 RTX Pro 6000 上的部署配方。主要更新包括增加了非投机解码、MTP 和 DSpark 的变体,以及高吞吐和低延迟选项。文档显示,在单张 RTX 5090 上使用 NVFP4 加 DSpark 可达 206.1 tok/s 的解码速度。所有配方均可作为调整基础,用户需根据实际用例微调标志和配置。
「Infra」频道最新
- 10 万亿美元数据中心卡壳:GPU 需 230GW,美国电网只能供 100GW — PeterDiamandis · 2026-08-18
- 电网瓶颈导致 10 万亿美元 AI 算力缺口 — PeterDiamandis · 2026-08-18
- 探讨:是否有人在本地 Linux VM 运行 Bot — Daniel_Farinax · 2026-08-18
- PotatoMesh:去中心化 LoRa 节点联邦可视化面板 — tom_doerr · 2026-08-18
- llama.cpp 自适应 MTP PR:代码生成提速最高翻倍 — Look_0ver_There · 2026-08-18
- CoreWeave CEO:算力需求将供不应求数年 — Beth_Kindig · 2026-08-18