Eragon AI 用模型路由省下数十万美元推理成本
shensi · x · 2026-10-01
AI 办公智能体公司 Eragon AI 公开案例:通过 Merge Gateway 单一端点将每个 agent 任务路由到最合适的模型,预计今年节省数十万美元推理成本。
要点:
- 问题:早期几乎所有请求都打到最强模型,但查邮件、文档检索等任务并不需要前沿级智能;模型配置一度成为全职工程工作,占约 1.5 名工程师的产能
- 做法:自建路由逻辑,按 prompt 分类选模型;支持客户自定义偏好(如编码用一个模型、写邮件用另一个),并兼顾数据驻留、成本与可用性
- 结果:质量不变的前提下,预计年省数十万美元推理开销,并释放约 1.5 名工程师的工作量
对做多 agent 产品的团队,「按任务路由模型」是可复用的降本思路。
「编程与Agent」频道最新
- 微软 Foundry 系列开篇:模型越强,内容抽取层越不可省 — adnan_hashmi · 2026-10-01
- 周用 60+ 小时深度实测:个人 Agent 横评 Muse 力压 Dots 与 Grok Bot — brandon_galang · 2026-10-01
- MV 彩蛋也出自 Claude:包括 llama 玩笑与英国版权条款 s9(3) — technollama · 2026-10-01
- 三模型协作:ChatGPT 写词、Suno 配乐、Claude 写代码逐帧画出 MV — technollama · 2026-10-01
- 新工具支持对各种 factory 配置直接跑基准测试 — vikvang1 · 2026-10-01
- 推理引擎 Magnitude 登顶 HN:本地跑开源模型比 llama.cpp 快至 2 倍 — nickbaumann_ · 2026-10-01