Anthropic Fable 5.1 登顶 Bug Hunt Bench,超 GPT-5.6

在针对 2 个真实代码库、105 个植入 Bug 的 Bug Hunt Bench 测试中,Anthropic 的 Fable 5.1 修复了 43 个 Bug,超越 GPT-5.6 Sol 的 42 个和 Grok 4.6 的 27 个,登顶排行榜,并成为首个达到帕累托前沿的模型,即同时做到更快、更便宜且性能更强。该基准还公开了详细数据与收据以供验证前沿编程模型的真实表现。

2026-09-02 ~ 2026-09-02 · 4 条相关