模型路由基准:Sol high 更稳
petburiraja · reddit · 2026-07-11
作者做了一组按角色划分的本地 benchmark,用来决定在 Codex/CLI 工作流里,不同任务该路由到哪个模型或档位。
主要结论
- 在战略决策类任务上,Sol high 接近参考结果,且比 Sol max 更省时间和推理 token。
- 在仓库驱动的执行 brief 上,Sol medium 比 high 更快,推理 token 少很多,但 high 在依赖推理上仍略占优。
- 在带有植入 bug 的修复任务中,多条实现路线都能首轮通过测试,说明这些低档位模型在受限任务上也能稳定工作。
作者的路由建议
- main strategic session:Sol high
- main operational session:Sol medium
- consequential review:Sol xhigh
- manual deep review:Sol max(少用)
- read/map/cleanup:GPT-5.4 mini low
- tight tested implementation:Sol low
- implementation rollback:GPT-5.4 medium
备注
作者也强调了局限性:样本量小、评估者知道模型身份、CLI 开销会影响延迟,且这些结果只是本地工作流的参考,不等于通用智能排名。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11