GPT模型登顶ProgramBench,长程编程仍存挑战

parth007_96 · x · 2026-08-11

在针对长程软件工程的 ProgramBench 基准测试中,OpenAI 的 GPT 模型(GPT 5.6 Sol xhigh)取得第一名,成功完美重建了测试中的 2/200 个程序(如 cmatrix 和 Rust hexdump viewer)。

尽管夺冠,但该基准测试的整体解决率极低。目前主指标(完全解决)仅为 1%,而次级指标(接近解决)的最高得分也仅为 16.5%,表明大模型在处理复杂的长周期软件工程任务时仍有巨大提升空间。

所属事件:GPT 5.6 Sol 登顶 ProgramBench,重构成本减半但偏科 Python(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →