托管推理三大迷思:单价不是账单、端点不可互换、自建未必省
TangeloOk9486 · reddit · 2026-09-27
作者总结了托管推理(hosted inference)讨论区反复出现的三个迷思:
- 迷思一:每 token 单价就是成本。 实际上缓存行为(cache)、批处理形状(batch shape)和最低消费才决定真实账单,标价只是开场。
- 迷思二:所有 OpenAI 兼容端点可互换。 模型版本新旧、冷启动、速率限制和支持质量才是产品本身;API 形状只是入场券,无论直连厂商还是 deepinfra 这类托管方。
- 迷思三:规模化后自建一定赢。 只有持续利用率够高时才成立;低于该水平,运维人力加闲置显存的隐性成本往往超过按量付费。
结论:托管商之所以繁荣,是因为多数团队宁愿按 token 付钱也不想自己养 GPU。欢迎讨论纠偏。
「Infra」频道最新
- Salesforce 提出随机驱逐 KV Cache,不挑不拣反而不输精挑细选 — jiqizhixin · 2026-09-27
- 4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B — ImBadGuyInEveryStory · 2026-09-27
- 自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路 — A_K_Nain · 2026-09-27
- TensorSharp 开源框架支持单请求混合文档/图像/视频/音频证据 — fuzhongkai · 2026-09-27
- 智库学者反数据中心抗议者现场交锋,为算力建设辩护 — neil_chilson · 2026-09-27
- Kafka 上生产才见真章:分区倾斜与消费滞后成大坑 — goyalshaliniuk · 2026-09-27