A100 实测:串行 8 次调用比一次批量生成多耗 4.86 倍 GPU 能源
iowastate · hf · 2026-09-19
论文指出,test-time scaling 的成本评估只看候选数 N 不够——同样的 N,执行方式不同,系统能耗和延迟差异巨大。
- 准确性验证:在 500 条 GSM8K 提示上,Phi-3-mini 与 Qwen2.5-1.5B 的候选数从 1 增到 8,准确率分别提升 8.4 和 18.4 个百分点
- 调度对比:固定 N=8,比较 1x8、2x4、4x2、8x1 四种生成调度(axb 表示 a 次调用、每次 b 个候选)
- 关键结果:在 A100 上,8 次串行调用的总 GPU 能耗是单次批量调用的 4.64–4.86 倍,P95 延迟达 5.77–6.12 倍
结论:只要候选相互独立且显存允许,应尽量用更少调用、更大 batch;评测报告应同时披露生成调度与 GPU 级系统指标。
「Infra」频道最新
- ProgramAsWeights:用英语描述AI函数,编译成权重离线跑 — yuntiandeng · 2026-09-19
- 开源引擎 Magnitude:先测你的硬件能跑什么本地模型,再自动下载调优 — nickbaumann_ · 2026-09-19
- ContinuityBench 论文:有状态 failover 可保留 99.2% 对话上下文 — its_vayishu · 2026-09-19
- AI 数据中心遭遇电力瓶颈,分析师力推 Bloom Energy 作 2026 首选股 — Beth_Kindig · 2026-09-19
- Jev实测:实时消化Bluesky全量推文流并分类动物贴 — danshipper · 2026-09-19
- Gensyn 开放审计首个可审计训练运行 open-1b,已记录 28 个哈希 — benfielding · 2026-09-19