自托管模型用抢占式云实例划算吗?Reddit热议成本与可行性
Different-Monk5916 · reddit · 2026-08-15
Reddit用户探讨在云抢占式实例(如GCP的L4、A100)上自托管LLM(使用vLLM/LiteLLM)的可行性,以降低推理成本。用户设想批量处理任务,利用抢占式实例的低价(L4低于1美元/小时,A100约2-3美元/小时),但面临实例被回收、模型加载开销、存储成本等问题。用户询问每周20小时使用是否经济,并寻求类似经验。
「Infra」频道最新
- 美参议员致信三大AI巨头威胁暂停开发,英伟达联手华尔街推算力证券 — PeterDiamandis · 2026-08-15
- Fireship:边缘 ML 摄像头如何构建无证追踪网络 — Fireship · 2026-08-15
- Qwen 官方指南:调节推理深度与 1M 上下文扩展 — solyarisoftware · 2026-08-15
- 用户发现 DeepSeek V4 Pro 需在 Linux 环境下正常运行 — teortaxesTex · 2026-08-15
- Tiny-Qwen 更新:纯 PyTorch 实现 27B 模型 — No-Compote-6794 · 2026-08-15
- 4×AMD V620 跑 DeepSeek-V4-Flash:300K 上下文,生成 21 tok/s — Thin_Pollution8843 · 2026-08-15