Fable 5.1 夺冠 Bug Hunt Bench,表现超 GPT-5.6
PawelHuryn · x · 2026-09-02
PawelHuryn 公布了 Bug Hunt 基准测试的最新结果。该测试包含 2 个真实代码库和 105 个植入 Bug。Fable 5.1 (max) 以修复 43 个 Bug 的成绩位居榜首,领先于 GPT-5.6 Sol (max) 的 42 个和 Grok 4.6 的 27 个。此外,Fable 5.1 比 GPT-5.6 Sol 快 2.24 倍,且比上一代 Fable 5 便宜 26%。
所属事件:Anthropic Fable 5.1 登顶 Bug Hunt Bench,超 GPT-5.6(4 条相关)→
「编程与Agent」频道最新
- Fable 5.1 删除代码测试飙至 3.3 万行 — Sauers_ · 2026-09-02
- 基于 MCP 的智能体自主 A/B 测试系统 — Ok-Shower7286 · 2026-09-02
- OpenClaw 2.0 推出多人协作智能体工作区 — The AI Daily Brief · 2026-09-02
- 实测:用 Grok Bot 担任项目经理安排工作 — mazzaTalk · 2026-09-02
- 吴恩达:只会“Vibe Coding”不够,需掌握软件工程地基 — DeepLearningAI · 2026-09-02
- GitHub CLI 新增 --attach 功能,支持命令行传图发视频 — mariorod1 · 2026-09-02