Bug Hunt Bench 排行榜:Fable 5.1 数据细节与对比

PawelHuryn · x · 2026-09-02

Bug Hunt Bench 公开了详细的数据和收据(Data and receipts),用于验证 Frontier 编程模型在真实植入 Bug 仓库中的表现。

该基准测试特点:

排行榜按修复的 Bug 数量(共 105 个)排名,并提供了成本(对数轴)和耗时(线性轴)的可视化对比图表,以展示不同模型在性能、速度和成本上的帕累托前沿分布。

所属事件:Anthropic Fable 5.1 登顶 Bug Hunt Bench,超 GPT-5.6(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →