200题完全重建代码:ProgramBench测试曝光,GPT 5.6仅解1%

jyangballin · x · 2026-08-11

Meta超级智能实验室联合斯坦福、哈佛推出了 ProgramBench 基准测试,评估语言模型从零构建代码库的能力。测试要求 Agent 仅根据编译后的二进制文件和文档,架构并实现能复现原程序行为的完整代码库,共计 200 道任务。

榜单数据显示,当前最强模型也难以胜任该任务:排名第一的 GPT 5.6 完全解决率仅为 1.0%,Claude Opus 4.8 完全解决率为 0%(但有 16.5% 的任务通过了 95% 的测试)。研究者指出,模型并非单纯复述源代码,而是能构建出真正新颖的解决方案。

所属事件:GPT 5.6 Sol 登顶 ProgramBench,重构成本减半但偏科 Python(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →