LLM 单次成本翻三倍,原因不是流量而是重试和 prompt 膨胀
Lance_Saul_85 · reddit · 2026-07-21
这条帖子讲的是一个很真实的线上成本事故:请求量没涨,但单次请求成本翻了三倍。
- 复盘后发现,第一个问题是超时重试逻辑:在某些故障模式下,一次请求会触发 3 次全价调用。
- 第二个问题是共享 system prompt 在没人治理的情况下不断累积,几个月下来接近 4k tokens,而且里面还出现了彼此矛盾的指令。
- 重试 bug 已经修好,但 prompt 膨胀更像组织问题:每个人加一句都有理由,却没人愿意删别人的护栏,所以作者在找一种更自动、更多“无聊”的治理方式。
- 这条帖子的价值在于提醒团队:LLM 成本上涨,很多时候不是流量问题,而是工程债和 prompt 管理问题。
「Infra」频道最新
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11
- 英伟达已成主流 Robotaxi 栈核心:训练仿真车载计算全覆盖 — pdamodaran · 2026-09-11
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- RunningHub 开源 H3Lightning:MiniMax H3 视频生成提速约 12 倍 — 智东西 · 2026-09-11