实测同模型换 harness 省 1/3 成本,Reddit 用户自建 LLM 自动路由
leebase65 · reddit · 2026-09-13
一位开发者分享了自己用数据驱动方式控制 AI 编码成本的完整实践:
- 度量方式:他认为"每 token 成本"是坏指标,应改用"每次成功任务的成本"。他用自己真实编码数据建了定制 benchmark,按 planner、supervisor、coder、code review 四种角色分别测试不同模型和 harness。
- 关键发现:同一模型在 Pi 与 Codex 两个 harness 中运行,成本和时间相差超过 1/3;他持续记录每次运行的模型、harness、耗时与成败,用数据替代感觉做决策。
- 自动路由:他搭建了按成本与性能优化的实时路由器,把订阅额度折算成低于 API 的真实成本,避免路由到剩余额度 ≤10% 的套餐,订阅耗尽则回退到最便宜的按量 API。策略是先用 DeepSeek V4.1 Flash、GLM 5.3 Flash 等超低价模型,失败再升级到更强模型。
- 订阅调整:他从 OpenAI/Anthropic/Gemini 各 $100/月改为 OpenAI $200(额度 4 倍)+ Anthropic、Gemini 降为 $20,使用量翻倍以上。
- 该系统目前深度集成于他的 AI Employee Factory 平台,计划拆分出来开源。
「编程与Agent」频道最新
- 纯 Rust 写的 AI 模块化合成器:带完整 MCP 接入 — simply-chris · 2026-09-13
- yacine 晒纯手机对话 AI 完成的第三版 CAD 设计 — yacineMTB · 2026-09-13
- CoreWeave Hacks 开幕:200+ 开发者 24 小时造「能自我纠错」的 Agent — wandb · 2026-09-13
- 开发者用 Rork 重构 2019 年旧应用:AI 时代上架效率大增 — rudrank · 2026-09-13
- 让 agent 把截图拼成联络表省 token,大幅减少图片读取开销 — pvncher · 2026-09-13
- Ruff 作者:我们高估了人类代码质量,尤其是自己的 — charliermarsh · 2026-09-13