提示缓存反烧钱:无人读取的缓存写入溢价正悄悄抬高你的 LLM 账单
gethackteam · x · 2026-09-13
推文提醒开发者检查提示缓存(prompt caching)的实际收益,避免为没人读取的缓存反复支付写入溢价:
- 检查服务商的缓存写入加价(write premium)、过期时间与实际复用率
- 折扣的缓存读取价救不了「每个请求都在新建缓存」的情况
- 以 Anthropic 为例,默认缓存 TTL 只有 5 分钟,很可能持续亏钱
「Infra」频道最新
- M5 Pro 64GB 本地跑 Qwen 实测:仅约 20 tok/s,长上下文更慢 — rJohn420 · 2026-09-13
- Rene Haas:为何多数 AI 芯片创业公司注定失败 — No Priors · 2026-09-13
- xAI孟买数据中心自备电源,为冲击千亿美元ARR铺路 — PaulYacoubian · 2026-09-13
- DeepSeek 发布 V4.1-Flash KV 缓存压缩法,大幅降低推理内存成本 — justlikemedics · 2026-09-13
- 谷歌斥 151 亿美元建芬兰 AI 基础设施,含三个数据中心与核电协议 — Beth_Kindig · 2026-09-13
- 端侧模型推荐:LFM2.5-2.6B 与 MiniCPM5-2B 获开发者青睐 — reach_vb · 2026-09-13