自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug

Paweł Huryn 用自建的 Bug Hunt Benchmark(考察模型在真实代码仓库中发现并修复困难 bug 的能力)进行测试,得出与其他榜单不同的结论:此前表现受质疑的 GPT-6.1 Sol 在任务中能够实现翻盘修复,而 Muse 系模型仍是最便宜的主力选择。该结果引发了社区对现有基准测试能否真实反映模型代码调试能力的讨论。

2026-10-07 ~ 2026-10-07 · 2 条相关

事件全程(共 2 集)→