Hyperagent 真实浏览器任务对比 Opus 5 和 GPT-5.6 Sol

PrajwalTomar_ · x · 2026-07-27

帖子用 Hyperagent 在真实浏览器 agent 场景里,让 Opus 5 和 GPT-5.6 Sol 跑同一批真实任务,并逐次记录每次运行成本。

作者认为这种测试比单纯看榜单更有意义,因为它更接近自己做客户项目时的实际使用方式。结论是:更便宜的模型反而多次扛住了压力,模型选择并没有想象中那么“一边倒”。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →