主流编程基准任务类型单一,Terminal-Bench覆盖更全

近期分析指出,当前主流编程基准测试的任务分布严重失衡,高度集中在特性实现(如668个任务)和Bug修复上,而缺乏对算法实现、代码迁移和性能优化等真实场景的覆盖。相比之下,Terminal-Bench在任务类型的丰富度与全面性上表现更优,被认为能更好地评估模型在实际编程环境中的综合能力。

2026-07-24 ~ 2026-07-24 · 3 条相关

另有 1 条近重复转述:zainhas