GPT模型登顶ProgramBench,长程编程仍存挑战
parth007_96 · x · 2026-08-11
在针对长程软件工程的 ProgramBench 基准测试中,OpenAI 的 GPT 模型(GPT 5.6 Sol xhigh)取得第一名,成功完美重建了测试中的 2/200 个程序(如 cmatrix 和 Rust hexdump viewer)。
尽管夺冠,但该基准测试的整体解决率极低。目前主指标(完全解决)仅为 1%,而次级指标(接近解决)的最高得分也仅为 16.5%,表明大模型在处理复杂的长周期软件工程任务时仍有巨大提升空间。
所属事件:GPT 5.6 Sol 登顶 ProgramBench,重构成本减半但偏科 Python(6 条相关)→
「模型」频道最新
- DeepSeek Harness v4 发布,Logo 曝光 — teortaxesTex · 2026-08-11
- 曝 OpenAI 新模型预训练代号 Doug,此前曾落后 — weswinder · 2026-08-11
- 吐槽:受够了吹捧便宜模型达到 Opus 水准的评测水文 — xeophon · 2026-08-11
- Muse Glimmer 智能体评测落后,但工具调用与幻觉控制优于同级 — ArtificialAnlys · 2026-08-11
- OpenAI 推出限制更少的模型,专供网络安全防御者使用 — lofty23_smart · 2026-08-11
- 坐拥算力与数据优势,谷歌顶级模型为何仍不敌 Claude 与 GPT? — prasenx · 2026-08-11