开源 sparkDash 2.0:私有化 GPU token 工厂的产能看板
aigclink · x · 2026-10-10
MiaAIlab 开源了 sparkDash 2.0——一个面向私有化推理集群的运营看板,作者以 4 台 DGX Spark 跑 GLM 5.3 Flash 的真实场景打磨而成,把 GPU 集群当"工厂产线"来管理:
- 产线状态:每台机器一张卡片,展示 GPU、CPU、统一内存、存储、网络与当前服务模型;任何带 NVIDIA 卡的 Linux 机器都能接入,从 UI 加机器无需重启。
- 产能指标:直接读取 vLLM / SGLang / llama.cpp 等引擎指标——实时 decode/prefill tok/s、KV cache 占用、运行/等待队列、TTFT、ITL p95、抢占、prefix cache 命中率、MTP 接受率。
- 质量验收:内置压测——Decode bench(1/2/4/8 并发总吞吐与单流吞吐)、Prefill bench、Quality bench(GSM8K、MMLU、指令遵循)、69 个场景的 Tool Eval Bench;结果留档,换模型/量化/引擎前后一对比即可看出质量回退,适合私有化交付验收。
- 成本核算:token 总量按模型/按天、生成与读取分开统计,含缓存命中率;Fleet energy 面板算功耗、24 小时耗电、电费与每千 token 能耗,直接回答"自建比调 API 便宜多少"。
- 运营操作:面板上启停模型、优雅关机、Wake-on-LAN 等。
所属事件:sparkDash 2.0 开源:私有化 GPU 集群运营看板(2 条相关)→
「Infra」频道最新
- 清华 TokenRouter 论文:token 级大小模型路由,吞吐最高提升 64 倍 — rohanpaul_ai · 2026-10-10
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- 网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒 — HankYeomans · 2026-10-10
- vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍 — vllm_project · 2026-10-10
- vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10
- AMD 联手 ai& 办东京黑客松:4.5 小时用 Kimi、GLM、Qwen、MiniMax 搭建 — DavidBennett__ · 2026-10-10