Fable 5.1 编程评分超 Opus 5
firstadopter · x · 2026-09-02
在 Terminal-Bench 4.0 测试中,Fable 5.1 得分 55.8%,超过 Fable 5 的 42% 和 Opus 5 的 52.3%。它在 Agent 编程和计算机使用评估中也表现领先。
所属事件:Anthropic 发布 Fable 5.1 与 Mythos 5.1,缓存降价 75%(174 条相关)→
「编程与Agent」频道最新
- 与 AI Agent 共事为何更累:委托不减反增心智负担 — bendee983 · 2026-09-12
- 用户称 Codex 已成 Linux 系统管理主界面:「Codex, 修好它」 — mark_k · 2026-09-12
- Kimi K2.7 后训练复盘:泛化到未见评测、轨迹步数反降三成 — echen · 2026-09-12
- 1700 个任务做 RL,Kimi K2.7 五项编码评测全线大涨 — echen · 2026-09-12
- 关键输入交给 AI 智能体后如何复现研究?EDSL 通用远程缓存给出答案 — soumitrashukla9 · 2026-09-12
- iLands 智能体痴迷溯源查证,大量 token 花在互相怀疑上 — repligate · 2026-09-12