自费实测 15 个 GPU 任务:成本估算平均偏高 33%
Worldly_North_7213 · reddit · 2026-09-14
作者自掏腰包 33.60 美元跑了 15 个任务(三家 GPU 供应商、四类负载:7B QLoRA、bf16 LoRA、bge-large 嵌入、两个图像任务),先按公开规格与价目表建成本估算器再冻结实测对比。
结果:
- 前 9 个任务平均误差 33%,且全部偏高。原因有二:配置耗时高估(假设 10-14 分钟,实际容器 5-10 秒启动、pip 23-57 秒);吞吐先验过时(A6000 实际快 1.8 倍、L40S 1.4 倍、A100 1.3 倍)。
- 用实测吞吐重新校准后,见过配置的 6 个任务误差在 20% 内(3/6);外推场景仍崩:未测精度设置 +85%、CPU 瓶颈任务 +151%、三次重启的 spot 任务 +46%。
关键数字: 同一 7B 微调、H100-SXM($3.29/h):QLoRA nf4 花 $3.14/56 分钟,bf16 LoRA 花 $1.50/26.5 分钟(用 71/80GB 显存)。注意两者梯度检查点设置也不同。80GB 卡上 nf4 反而是最贵默认;24GB 卡上 nf4 是唯一选项(H100 无原生 FP4,Blackwell 上结论可能不同)。
- 每百万训练 token 成本:spot 4090 $0.20、H100 bf16 $0.30、H100 QLoRA $0.63;托管微调刊牌价约 $0.48-0.50。
结论:每种配置跑一次实测胜过任何表格——校准后同配置复报价误差 8% 以内(但属样本内拟合)。
「Infra」频道最新
- Kokoro 语音模型移植 Core AI:54 种声音 iOS 端侧零成本运行 — amos_gyamfi · 2026-09-14
- 8GB 显存跑 35B MoE 模型,投机解码到底该不该开 — Infinite-Local5435 · 2026-09-14
- 512MB 内存小板子跑 Agent:内存与执行分离实现跨机自迁移 — D777Castle · 2026-09-14
- 3000 会话 300 亿 token 实测:模型真正输出只占 0.3%,97% 输入来自缓存 — Rare_Guide_9830 · 2026-09-14
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14