Agent Arena 显示 Claude Opus 5 跑赢 GPT-5.6,但成本更高
infwinston · x · 2026-07-30
帖子引用了 Agent Arena 上的对比结果,讨论 Claude Opus 5 和 GPT-5.6 的 test-time scaling 表现。
结论
- Opus 5(High) 和 Opus 5(Max) 都跑赢了 GPT-5.6 Sol(xHigh),但成本更高
- Opus 5(Medium) 的表现大致追平 GPT-5.6 Sol(xHigh),成本也接近
- 在这组对比里,Fable 5(High) 的性价比最好
这条信息的重点是:agent 的真实成本不只看 token 单价,还要看整段任务执行过程里的反复迭代和工具调用;它们会显著抬高最终账单。
所属事件:Agent Arena 榜单:Claude Opus 5 跑赢 GPT-5.6(4 条相关)→
「编程与Agent」频道最新
- 用 Gemini agent 自动重置 50+ 泄露密码,网友设想新玩法 — sup_nim · 2026-09-23
- OpenAI 创业团队负责人:2026 年「万物皆编码 Agent」,简洁即强大 — RichmanRonald · 2026-09-23
- 开发者用 Flash 模型复刻 Infinite Craft 翻车,求助选型 — DisastrousUpstairs23 · 2026-09-23
- 桌面上常备一部 iPhone,让 Agent 统一驱动手机与电脑 — signulll · 2026-09-23
- Agent 架构法则:验证器可参与生成反馈,但不得直接晋升候选解 — blaizedsouza · 2026-09-23
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23