Fable 5.1 碾压最难基准,超国产一代
minchoi · x · 2026-09-02
开发者分享了对 Claude Fable 5.1 的实测结果。在其个人“最难的基准测试套件”(无碰撞、多约束)中,Fable 5.1 完全摧毁了所有其他模型,并让中国前沿模型瞬间过时。评价称其相比 Fable 5 有着代际级别的飞跃。
「编程与Agent」频道最新
- 两招帮 Claude 账号每月省下 1500 万 Token 成本 — dotey · 2026-09-02
- Meta 新研究:Agent 能完成任务却无法阻止灾难性操作 — rohanpaul_ai · 2026-09-02
- Hamel 探讨避免 AI 技能优化中的过拟合问题 — HamelHusain · 2026-09-02
- AnySearch:单一策略适应任意预算的强化学习搜索框架 — _reachsumit · 2026-09-02
- FreshCtx 0.9.0 修复 Agent 证据时效性 TOCTOU 漏洞 — Street-Chest2270 · 2026-09-02
- 新法通过事实效用估计实现搜索代理的密集过程监督 — _reachsumit · 2026-09-02