LLM 单次成本翻三倍,原因不是流量而是重试和 prompt 膨胀
Lance_Saul_85 · reddit · 2026-07-21
这条帖子讲的是一个很真实的线上成本事故:请求量没涨,但单次请求成本翻了三倍。
- 复盘后发现,第一个问题是超时重试逻辑:在某些故障模式下,一次请求会触发 3 次全价调用。
- 第二个问题是共享 system prompt 在没人治理的情况下不断累积,几个月下来接近 4k tokens,而且里面还出现了彼此矛盾的指令。
- 重试 bug 已经修好,但 prompt 膨胀更像组织问题:每个人加一句都有理由,却没人愿意删别人的护栏,所以作者在找一种更自动、更多“无聊”的治理方式。
- 这条帖子的价值在于提醒团队:LLM 成本上涨,很多时候不是流量问题,而是工程债和 prompt 管理问题。
「Infra」频道最新
- Nvidia Rubin 即将登场,指向下一代 AI 算力平台 — ezyang · 2026-07-21
- Tesla FSD v14 Lite 预计推向 400 万辆旧 HW3 车 — MatthewBerman · 2026-07-21
- 台积电 3nm 利用率据称超 120%,AI 需求推高 1900 亿美元资本开支 — tengyanAI · 2026-07-21
- Nativ 用桌面应用和本地 API 把模型带到 Mac 上 — Simon Willison · 2026-07-21
- Octen称Agent搜索P50仅62毫秒,P90差距只有6毫秒 — aakashgupta · 2026-07-21
- 智谱收购编译器团队,押注国产芯片推理优化 — zephyr_z9 · 2026-07-21