120 次实测:agent 省钱靠护栏不靠动态路由,好模型反而更便宜
shane-testronaut · reddit · 2026-10-11
作者为 agentic 浏览器测试系统构建了一个用 Jev 实现的推理层,实验动态模型路由是否省钱,结果推翻了初始假设:
- 最强结果来自固定执行模型+加护栏:带护栏的 GPT-5.5 在 15/15 次任务中全部成功,且比无护栏的 Terra 对照组少用 13.7% token。
- 跨厂商动态选择测试(120 次独立任务):每次选择决策本身只花约 621–724 token,但动态路由配置在整体 token 上没有优势。
核心结论:与其问「这一步最便宜的模型是什么」,不如问「整条任务最便宜的成功轨迹是什么」——更强的模型避免重试、错误决策和无谓探索,总成本反而更低。方法论、条件级数据与注意事项已公开。
「编程与Agent」频道最新
- 用 Grok Code 一天自建健身追踪 App,含冰箱拍照识菜功能 — kevinkern · 2026-10-11
- 重度用户公开 Claude Code 实战手册:提示词降三分之二,产出涨八倍 — AaronBergman18 · 2026-10-11
- Gaussian splatting+摄像头做出以假乱真网页效果,引隐私争议 — RileyRalmuto · 2026-10-11
- Claude Opus 5.5 太能反编译,《使命召唤》《光环》全被搬进浏览器 — SuB8u · 2026-10-11
- haiku 5.5 被赞疯狂性价比:百美元内让 agent 批量改上万文件 — JasonDClinton · 2026-10-11
- Polyphonic 更新:一个窗口统筹 Claude Code 与 Codex 多智能体 — RileyRalmuto · 2026-10-11