ArgaBench 发布:Opus 5 在多应用 Agent 任务中领跑
Daisy4ai · x · 2026-09-01
发布了 ArgaBench,这是一个包含 40 个任务的跨领域基准,用于衡量 Agent 在 IT、营收、市场营销、软件开发和电商等多应用工作流任务中的表现。
在 32 种配置的测试中,模型通过率排名如下:
- Opus 5:70.8%
- Fable 5:60.0%
- GPT 5.6 Sol:50.8%
「模型」频道最新
- 关注具体场景而非最强模型,选型逻辑正在变化 — aftahi_ai · 2026-09-01
- 用户吐槽 GPT-5.6 代码与幻觉问题,寄望 GPT-6 改善 — Prestigiouspite · 2026-09-01
- Z.ai 推出 GLM-5.3-Flash:320B 参数、支持百万上下文与 NVFP4 量化 — alejandroll10 · 2026-09-01
- 传 GPT-6 已近人类计算机操控水平 — jYtanYj · 2026-09-01
- 开源模型转向非商用许可,后训练授权或成千亿市场 — zephyr_z9 · 2026-09-01
- Hailuo H3 Max 速度够快,用户用它做出了可交互 AI 开放世界 RPG — mtizard · 2026-09-01