推理成本怎么降?Reddit 发帖征集生产级 LLM 省钱实战经验

Ok_Philosophy_4031 · reddit · 2026-09-27

一位开发者发帖询问:当 LLM 推理费用成为真正的 COGS 成本项后,团队实际是怎么控成本的?

帖子里列出了常见的纸面方案——换便宜模型、压缩 prompt/token、缓存、批处理、路由、微调小模型、自托管等——但作者更想知道实际落地后的效果:

作者怀疑:博客与 benchmark 里的推理优化,和生产环境里团队真正愿意维护的方案之间,存在很大鸿沟。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →