按 GPU 小时而非 MAE 评测 6 个负载预测器:无一跑赢「上一次观测值」

Vegetable-Top-3670 · reddit · 2026-09-03

作者针对 NVIDIA Dynamo 的 SLA Planner(用 predictnext() 单步预测负载来决定 prefill/decode worker 数量),构建了一个以 GPU 小时和 SLO 违约率(而非 MAE)计分的评测 harness。关键方法:先把每个预测器扫到满足同样 1.0% 违约目标的最便宜供应余量,再比较成本。

在 BurstGPT 轨迹的 400 个区间上,结果:

核心发现:oracle 比上值基线便宜 50-58%,说明这里有真金白银的优化空间,但六个预测器(含两个时序基础模型)都没吃到。作者判断单步预测场景下,上次观测值已包含大部分可用信号,接口设计(单点预测、无不确定性)在模型选择起作用之前就封顶了收益。试过改用 P90 分位数供应也无济于事:帮 Chronos、伤 TimesFM。

作者诚实列出局限:仅 400/29278 个区间、单窗口、解析模拟器未经引擎校准(只有相对比较有意义)、粗粒度余量网格导致结果偏上。代码 MIT 开源(200 个测试),并已就 ARIMA 默认设置向 Dynamo 上游提 issue。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →