Bending Spoons 99% AI 流量跑自托管开源模型,靠 evals 省钱

alex_verem · x · 2026-09-25

Bending Spoons 将 99% 的 AI 流量运行在自托管开源模型上。作者指出多数 CTO 默认给 agent 用最贵的前沿模型(Claude Opus、GPT-6 Astra),却答不上「怎么证明更便宜的模型能胜任」。能省钱的公司都做对了同一件事:把「正确答案」写下来——用生产环境真实案例、经专家签核的答案构建测试集,让每个候选模型都跑一遍。有了这套 evals,模型就变成可以货比三线的普通成本项:便宜模型处理常规任务,昂贵模型只兜底难例。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →