按 GPU 小时而非 MAE 评测 6 个负载预测器:无一跑赢「上一次观测值」
Vegetable-Top-3670 · reddit · 2026-09-03
作者针对 NVIDIA Dynamo 的 SLA Planner(用 predictnext() 单步预测负载来决定 prefill/decode worker 数量),构建了一个以 GPU 小时和 SLO 违约率(而非 MAE)计分的评测 harness。关键方法:先把每个预测器扫到满足同样 1.0% 违约目标的最便宜供应余量,再比较成本。
在 BurstGPT 轨迹的 400 个区间上,结果:
- oracle(完美预知):73.85 GPU 小时,0.00% 违约——上限
- constant(上次观测值):175.00,0.49%
- TimesFM 3.0:176.85,0.49%——与 constant 打平
- Chronos:264.05,0.27%——比「什么都不做」差 50%
- Kalman:370.30,0.93%;ARIMA:501.95,0.24%(Dynamo 默认)
- Prophet:1253.95,任何余量下都无法达标
核心发现:oracle 比上值基线便宜 50-58%,说明这里有真金白银的优化空间,但六个预测器(含两个时序基础模型)都没吃到。作者判断单步预测场景下,上次观测值已包含大部分可用信号,接口设计(单点预测、无不确定性)在模型选择起作用之前就封顶了收益。试过改用 P90 分位数供应也无济于事:帮 Chronos、伤 TimesFM。
作者诚实列出局限:仅 400/29278 个区间、单窗口、解析模拟器未经引擎校准(只有相对比较有意义)、粗粒度余量网格导致结果偏上。代码 MIT 开源(200 个测试),并已就 ARIMA 默认设置向 Dynamo 上游提 issue。
「Infra」频道最新
- 弗州 Loudoun 县20年变迁,预言美国数据中心未来 — suchenzang · 2026-09-03
- 数据中心轰鸣不停:前 Scale AI CEO 调侃反建 NIMBY — suchenzang · 2026-09-03
- 两台 DGX Spark 跑 GLM-5.3-Flash:自研内核让专家 GEMM 提速约 40% — EAccelerate_42 · 2026-09-03
- Beff Jezos:生物基底的每瓦算力被严重低估,硅基与生物走向共同复杂化 — beffjezos · 2026-09-03
- AMD 官方 Qwen3.8 MXFP4 量化无法在 llama.cpp 加载 — mailto_devnull · 2026-09-03
- 数据中心会否出现「绿色认证」标签,让用户按碳足迹选 token? — jdavid · 2026-09-03