AI 定价不只是 token 问题,背后是显存和算力成本
Kyrannio · x · 2026-07-23
这条内容在讲一个常被忽略的事实:AI API 定价不只是 token 价格,背后其实是硬件和内存成本。
配图和正文都在强调,账单里包含了模型权重常驻显存、显存带宽搬运权重、KV cache 保存上下文、以及 GPU 同时服务多请求的压力。模型越大、上下文越长,对实时内存和基础设施的占用就越高,因此价格也会被抬上去。
「Infra」频道最新
- 三行 prompt 改动,让 token 账单一周涨了 30% — Illustrious-Second-7 · 2026-07-23
- Google Cloud backlog 达 4620 亿美元,GenAI 收入增 800% — Beth_Kindig · 2026-07-23
- AMD Advancing AI 2026 会议现场排起长队 — DynamicWebPaige · 2026-07-23
- 开放模型可能比闭源模型更吃算力和内存 — BenBajarin · 2026-07-23
- Daft 接入本地 Transformers 推理,支持向量化 LLM 操作 — lhoestq · 2026-07-23
- MI455X 与 Venice 预告里露出一颗 chiplet 计算芯片 — scaling01 · 2026-07-23