AutomationBench 实测:GPT-6 Sol 完成业务工作流成本比 Fable 5.1 低 88%

OpenAIDevs · x · 2026-09-23

OpenAI 公布 AutomationBench(衡量 AI 模型能否跨应用完成真实业务工作流)成绩:GPT-6 Sol (xhigh) 领先 Fable 5.1 (max with Opus 5 fallback),且单任务报告成本低 88%。帖子同时附上 DeepSWE v1.1 数据:GPT-6 Sol (max) 逼近 Claude Fable 5 (xhigh),单任务成本低约 80%;Luna (max) 相当于 Fable 5 (medium),成本低约 96%。

所属事件:OpenAI 发布 GPT-6 Sol 与 Luna,价格砍半(48 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →