A100 实测:串行 8 次调用比一次批量生成多耗 4.86 倍 GPU 能源

iowastate · hf · 2026-09-19

论文指出,test-time scaling 的成本评估只看候选数 N 不够——同样的 N,执行方式不同,系统能耗和延迟差异巨大。

结论:只要候选相互独立且显存允许,应尽量用更少调用、更大 batch;评测报告应同时披露生成调度与 GPU 级系统指标。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →