Opus 5 被称在三项表格智能体基准上跃升
surmenok · x · 2026-07-25
Opus 5 被称在表格智能体基准上大幅领先
这条帖子转述了一个评测结论:Opus 5 在 spreadsheet agent 场景里,相比 Fable 5 和 GPT-5.6 Sol 有明显跃升,作者甚至形容这是又一次“Opus 4.5 式”的能力跳变。
配图里的关键信息
- 图中比较了 3 个表格智能体基准:Stage Gate、ShortcutBench V2、ShortcutBench V1。
- Opus 5 在图里位于准确率前沿,标出的结果分别是 90.4%、78.1%、85.2%。
- 图注强调它在相近或更低的耗时与成本下,仍能保持领先。
- 另一处图注还写到,Fable 5 在中等推理强度下覆盖了 55/57 个 ShortcutBench V2 任务、19/20 个 Stage Gate 任务。
整体就是一条关于 AI 模型在表格/知识工作智能体任务上显著提升 的评测消息。
「模型」频道最新
- Opus 5 在 ARC-AGI 3 得到 30.2%,但基准价值遭质疑 — ChrSzegedy · 2026-07-25
- Opus 5 竟在抓 Opus 4.8 引入的 bug — damnGruz · 2026-07-25
- AMD 开源 Instella 16B MoE,连 RL 阶段都放出 checkpoint — bronzeagepapi · 2026-07-25
- Google 发布 1 小时智能体工程课程,讲记忆与 MCP — ifioknkem · 2026-07-25
- 一组图在对比当前各家 AI 的能力现状 — Fantastic_Recipe_ · 2026-07-25
- Claude Opus 5 上线,编程实测强但基准分数仍有争议 — Latent Space · 2026-07-25