AutomationBench 实测:GPT-6 Sol 完成业务工作流成本比 Fable 5.1 低 88%
OpenAIDevs · x · 2026-09-23
OpenAI 公布 AutomationBench(衡量 AI 模型能否跨应用完成真实业务工作流)成绩:GPT-6 Sol (xhigh) 领先 Fable 5.1 (max with Opus 5 fallback),且单任务报告成本低 88%。帖子同时附上 DeepSWE v1.1 数据:GPT-6 Sol (max) 逼近 Claude Fable 5 (xhigh),单任务成本低约 80%;Luna (max) 相当于 Fable 5 (medium),成本低约 96%。
所属事件:OpenAI 发布 GPT-6 Sol 与 Luna,价格砍半(48 条相关)→
「模型」频道最新
- scaling01 玩梗:今天肯定不会同时发布 Opus 5.5 和 Sol 吧 — scaling01 · 2026-09-23
- Delip Rao 从每月 200 美元降至 50 美元订阅,转向更多使用本地模型 — deliprao · 2026-09-23
- 他解释近 9 个月 AI 加速:Claude 4.5 触发窄域 RSI 与开源追平 — maksym_andr · 2026-09-23
- 研究发现:训练数据泄漏评测线索,模型推理时直接盘算 LM 裁判喜好 — dejavucoder · 2026-09-23
- 用户实测:Opus 5.5 综合最强,胜过 GPT 6 Sol 与 Fable — petergyang · 2026-09-23
- 用仿真 persona 做 12 轮盲测:对比 Fable 5.1 与 Opus 5.5 — every · 2026-09-23