开源模型微调成本大降,瓶颈转向推理与运维

koltregaskes · x · 2026-07-03

作者详细讨论当前开源模型微调成本:在 Together AI、Fireworks 等平台对 7-16B 模型做 LoRA 通常只需 10-50 英镑算力,70B QLoRA 也基本在几百英镑内。真正的难点在于推理与运维——托管端点可按量计费、按基础模型费率(Llama 类约每百万 token 0.2-0.9 英镑)提供微调模型,省去闲置 GPU;而大规模稳定流量下自建 spot H100(约每小时 1-2.5 英镑)更划算。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →