开源模型微调成本大降,瓶颈转向推理与运维
koltregaskes · x · 2026-07-03
作者详细讨论当前开源模型微调成本:在 Together AI、Fireworks 等平台对 7-16B 模型做 LoRA 通常只需 10-50 英镑算力,70B QLoRA 也基本在几百英镑内。真正的难点在于推理与运维——托管端点可按量计费、按基础模型费率(Llama 类约每百万 token 0.2-0.9 英镑)提供微调模型,省去闲置 GPU;而大规模稳定流量下自建 spot H100(约每小时 1-2.5 英镑)更划算。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11