AutomationBench 图表显示 Opus 5 更强于长程智能体任务

daniel_mac8 · x · 2026-07-25

这条帖子主张,这个模型应该默认使用“中等”思考强度;配图则给出了 AutomationBench 上的 agentic business workflow 对比图。

图表显示,Opus 5 在长程业务工作流任务上的通过率高于同图里的其他模型,随着 effort 提升,表现大致落在 22% 到 26% 区间。回复里还进一步给出一个判断:Fable 5 可能在单次输出任务上略强,但在衡量长周期任务完成能力的 agent 评测上,Opus 5 更占优。

所属事件:Anthropic 发布 Claude Opus 5 前沿模型(63 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →