AutomationBench 图表显示 Opus 5 更强于长程智能体任务
daniel_mac8 · x · 2026-07-25
这条帖子主张,这个模型应该默认使用“中等”思考强度;配图则给出了 AutomationBench 上的 agentic business workflow 对比图。
图表显示,Opus 5 在长程业务工作流任务上的通过率高于同图里的其他模型,随着 effort 提升,表现大致落在 22% 到 26% 区间。回复里还进一步给出一个判断:Fable 5 可能在单次输出任务上略强,但在衡量长周期任务完成能力的 agent 评测上,Opus 5 更占优。
所属事件:Anthropic 发布 Claude Opus 5 前沿模型(63 条相关)→
「模型」频道最新
- ARC-AGI-3 测试发现 Claude Opus 5 展现代数推理新能力 — typewriters · 2026-07-25
- Claude Code 触发拒绝后可静默回退到 Opus 4.8 — steipete · 2026-07-25
- 月之暗面 Kimi K3 宣布下周一发布,Baseten 送 API 额度 — baseten · 2026-07-25
- Claude Opus 5 据报在 2026 IMO 拿下 42/42 满分 — exordin26 · 2026-07-25
- Claude Opus 5 上线,Box 说企业 agent 任务大幅提升 — inductionheads · 2026-07-25
- 有人直言 Gemini 3.5 Pro 已经太晚难竞争 — teortaxesTex · 2026-07-25