200题完全重建代码:ProgramBench测试曝光,GPT 5.6仅解1%
jyangballin · x · 2026-08-11
Meta超级智能实验室联合斯坦福、哈佛推出了 ProgramBench 基准测试,评估语言模型从零构建代码库的能力。测试要求 Agent 仅根据编译后的二进制文件和文档,架构并实现能复现原程序行为的完整代码库,共计 200 道任务。
榜单数据显示,当前最强模型也难以胜任该任务:排名第一的 GPT 5.6 完全解决率仅为 1.0%,Claude Opus 4.8 完全解决率为 0%(但有 16.5% 的任务通过了 95% 的测试)。研究者指出,模型并非单纯复述源代码,而是能构建出真正新颖的解决方案。
所属事件:GPT 5.6 Sol 登顶 ProgramBench,重构成本减半但偏科 Python(6 条相关)→
「编程与Agent」频道最新
- Alchemy 2.0 支持 Next.js 等六大框架部署至 Cloudflare — samgoodwin89 · 2026-08-11
- 专治 AI 盲目写码:开源工具 cargo-cult 查杀「迷信代码」 — Rasmic · 2026-08-11
- Chrome 整合 Vercel AI SDK:借助内置 Prompt API 开发端侧 Web AI 应用 — gaganghotra_ · 2026-08-11
- 实测分享:直接下场写代码比口头鼓励更能让 Claude 智能体解围 — nptacek · 2026-08-11
- 利用 Figma MCP 五分钟克隆任意设计系统 — smtabatabaie · 2026-08-11
- graph-engineer:Claude 负责指挥,Codex 负责写码的自纠错工作流 — udmrzn · 2026-08-11