EpochAI 更新榜单:Claude Fable 5 长程任务得分远超 GPT-5.6
Jsevillamol · x · 2026-08-04
EpochAI 更新了 MirrorCode 长程任务基准测试排行榜。Claude Fable 5 以 64% 的解题率大幅领先,位居榜首;而 GPT-5.6 Sol 的解题率仅为 20%。
所属事件:EpochAI 更新榜单 Claude 3.5 Sonnet 登顶(2 条相关)→
「模型」频道最新
- Databricks 称 Kimi K3 推理速度已达 239 tokens/s — Yuchenj_UW · 2026-08-04
- Claude Max 用户讨论要不要再配 Codex Pro 或 GLM 5.2 — tinker_20 · 2026-08-04
- 数学家验证 GPT Pro:零计算错误,但证明表述极差 — josh_wills · 2026-08-04
- 蚂蚁员工长文:中国 AI 大厂的四个截然不同的战略赌注 — AcanthisittaOk1699 · 2026-08-04
- 传 OpenAI 将发 Astra 模型,主打多智能体协同 — thesaraharminta · 2026-08-04
- 实测 Qwen3.8-Max:开源模型在 Agent 任务已逼近闭源前沿 — dair_ai · 2026-08-04