推理成本怎么降?Reddit 发帖征集生产级 LLM 省钱实战经验
Ok_Philosophy_4031 · reddit · 2026-09-27
一位开发者发帖询问:当 LLM 推理费用成为真正的 COGS 成本项后,团队实际是怎么控成本的?
帖子里列出了常见的纸面方案——换便宜模型、压缩 prompt/token、缓存、批处理、路由、微调小模型、自托管等——但作者更想知道实际落地后的效果:
- 哪些优化真正省到了钱,哪些因工程复杂度不值得做?
- 质量/可靠性约束在多大程度上阻止团队切到便宜模型?
- 计费口径该看 $/token、$/request 还是 $/成功完成的任务?
- 支出里有多少来自真正的困难推理,多少来自抽取、分类、路由等重复性任务?
- 是否会主动判断某些 LLM 调用其实可以换成传统软件/ML?
作者怀疑:博客与 benchmark 里的推理优化,和生产环境里团队真正愿意维护的方案之间,存在很大鸿沟。
「编程与Agent」频道最新
- AI agent 什么都能干,为何十年内难普及?因为生活不够复杂 — menhguin · 2026-09-27
- 他定了个 AGI 标准:让 AI 替他校验 15 万条文档转换无误 — burkov · 2026-09-27
- 自改进 Agent 演讲上线:GEPA、Reflective Optimization 与快慢训练全解 — CShorten30 · 2026-09-27
- 微软高管分享 Autopilot 用法:聚合工作信息建例行任务 — heyneighbor · 2026-09-27
- 同一 prompt 跑一季度:线上 agent 政策遵守度随时间悄然漂移直至破防 — IsomuraArganee_95 · 2026-09-27
- 多智能体竞技场引入 Diplomacy,人类可挑战前沿 AI 社交策略 — ycombinator · 2026-09-27