模型路由基准:Sol high 更稳
petburiraja · reddit · 2026-07-11
作者做了一组**按角色划分的本地 benchmark**,用来决定在 Codex/CLI 工作流里,不同任务该路由到哪个模型或档位。 ### 主要结论 - 在战略决策类任务上,**Sol high** 接近参考结果,且比 **Sol max** 更省时间和推理 token。 - 在仓库驱动的执行 brief 上,**Sol medium** 比 high 更快,推理 token 少很多,但 high 在依赖推理上仍略占优。 - 在带有植入 bug 的修复任务中,多条实现路线都能首轮通过测试,说明这些低档位模型在受限任务上也能稳定工作。 ### 作者的路由建议 - **main strategic session**:Sol high - **main operational session**:Sol medium - **consequential review**:Sol xhigh - **manual deep review**:Sol max(少用) - **read/map/cleanup**:GPT-5.4 mini low - **tight tested implementation**:Sol low - **implementation rollback**:GPT-5.4 medium ### 备注 作者也强调了局限性:样本量小、评估者知道模型身份、CLI 开销会影响延迟,且这些结果只是本地工作流的参考,不等于通用智能排名。
「编程与Agent」频道最新
- Cursor agent 被称能为子 agent 选对模型和推理预算 — intellectronica · 2026-07-21
- 交互式 WebMCP 演示站展示 agent 如何驱动网页 — craigsdennis · 2026-07-21
- Agent Arena 发布 agent 评测因果追踪方法与完整榜单 — arena · 2026-07-21
- Codex Micro 把多智能体混乱做成了状态面板梗图 — shaunralston · 2026-07-21
- Anthropic 开发者体验负责人将讲 coding agents 的 API 体验 — craigsdennis · 2026-07-21
- 企业正在招聘 AI Agent 工程师,IBM 列出 7 项核心技能 — ZabihullahAtal · 2026-07-21