实测显示多 Agent 工作流不敌直接使用大模型

开发者通过 10 个测试任务对比了基于 Codex 的开源编排插件 Sol Advisor 的三种模式:强制使用 Luna Max 子代理、风险门控路由选择器以及仅使用 GPT-5.6 Sol 主模型。结果显示除中位时间外,仅用 Sol 主模型在各项指标上均表现更佳,表明当前多 Agent 工作流的实际效率可能不如直接调用强大主模型。

2026-08-19 ~ 2026-08-19 · 2 条相关