Claude Fable 5.1跑分曝光:OSWorld 77.9%等多项碾压对手
Scobleizer · x · 2026-09-02
据曝光的评测数据,Claude Fable 5.1 在多个基准上表现突出:agentic scientific research 52.6%、Terminal-Bench 55.8%、OSWorld 77.9%、CursorBench 73.4%,在多个基准上超过 Fable 5 与 GPT-5.6 Sol。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「模型」频道最新
- Devin Fusion 登上编码智能体榜:61.7 分仅差 Claude Code 4%,成本省 36% — ArtificialAnlys · 2026-09-12
- OpenAI 下周退役 GPT-5.3-Codex-Spark,高吞吐遗风引期待 — imjustnewatai · 2026-09-12
- Arcee 开源 NAC 长任务 agent 框架,实测 DeepSeek 模型 489 次工具调用 — MaziyarPanahi · 2026-09-12
- 蚂蚁 Ling-3.0-flash-VL 评测:5.5B 激活参数上帕累托前沿,幻觉率仅 22% — ArtificialAnlys · 2026-09-12
- 中国开源模型竞争太强,AI 实验室难以像 Uber 那样靠涨价回血 — firasd · 2026-09-12
- 前沿大厂隐私条款暗藏陷阱:点个赞你的对话就可能不被保护 — niloofar_mire · 2026-09-12