AI 推理服务被指比自租 GPU 贵 7 到 15 倍
JoshPurtell · x · 2026-07-27
AI 推理业务的 token 毛利率可能高到离谱
这条帖子的核心观点是:不少 AI 推理业务可能在明显高于成本的价格区间运营,用户对价格结构并不透明。引用里给出的一个例子是,跑 Qwen3.6 27B 的批量推理任务时,自租 GPU 比使用开放推理服务便宜 7 倍到 15 倍。
- 作者称,现实中可以看到 90%、95%、99.5% 甚至 99.9% 的 gross token margins。
- 这个对比说明,对批量、可预测的工作负载来说,开放推理提供商可能比自建/自租 GPU 显著更贵。
- 含义很直接:很多用户可能在推理定价上“被收割”了。
「Infra」频道最新
- 做本地 LLM 机器时该盯 RTX Ada 还是 5090 — egudegi · 2026-07-27
- 一篇文章拆解如何降低 Microsoft Fabric 容量成本 — adnan_hashmi · 2026-07-27
- Microsoft Fabric 的 sempy.fabric 包入门指南 — adnan_hashmi · 2026-07-27
- Voice AI 通话真实成本不止按分钟算 — decant338 · 2026-07-27
- 美光与 Meta 白皮书称 Spark 溢写 SSD 后可慢 38 倍 — dr_alphalyrae · 2026-07-27
- CUDA 基准测出 6400 万数求和快 20 倍 — ctjlewis · 2026-07-27