模型路由基准:Sol high 更稳

petburiraja · reddit · 2026-07-11

作者做了一组**按角色划分的本地 benchmark**,用来决定在 Codex/CLI 工作流里,不同任务该路由到哪个模型或档位。 ### 主要结论 - 在战略决策类任务上,**Sol high** 接近参考结果,且比 **Sol max** 更省时间和推理 token。 - 在仓库驱动的执行 brief 上,**Sol medium** 比 high 更快,推理 token 少很多,但 high 在依赖推理上仍略占优。 - 在带有植入 bug 的修复任务中,多条实现路线都能首轮通过测试,说明这些低档位模型在受限任务上也能稳定工作。 ### 作者的路由建议 - **main strategic session**:Sol high - **main operational session**:Sol medium - **consequential review**:Sol xhigh - **manual deep review**:Sol max(少用) - **read/map/cleanup**:GPT-5.4 mini low - **tight tested implementation**:Sol low - **implementation rollback**:GPT-5.4 medium ### 备注 作者也强调了局限性:样本量小、评估者知道模型身份、CLI 开销会影响延迟,且这些结果只是本地工作流的参考,不等于通用智能排名。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →