ProgramBench 榜单:最抢手模型完整重建程序解决率仅 4.5%
jyangballin · x · 2026-09-29
来自 Meta Superintelligence Labs、斯坦福与哈佛的 ProgramBench 基准正式更新:给定编译后的二进制文件与文档,agent 需从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
最新榜单亮点:
- Claude Opus 5 (xhigh) 以 4.5% 完全解决率、37% 接近解决率(≥95% 测试通过)排名第一,但单任务平均成本高达 $50.53
- GPT-5.6 Sol (xhigh) 以 1.0% / 15.5% 居第二,成本仅 $6.08;GPT 5.5、Gemini 3.6 Flash 等紧随其后
- 绝大多数模型(包括 Claude Opus 4.x 系列、GLM-5.2、GPT 5.4 mini 等)完全解决率为 0
作者还给各模型页面加了语言热度图(GPT 最爱写 .py),并在首页排行榜加入了 $/task 成本维度。该基准显示:从二进制逆向重建完整程序对当前最强的编码模型仍是极难任务。
「模型」频道最新
- Opus 5.5 声势碾压,OpenAI 员工却出奇放松,暗示有后手? — haider1 · 2026-09-29
- Yacine:人们只在乎软件工程基准,这是计算机科学的全面胜利 — yacineMTB · 2026-09-29
- 作者实测:Opus 5.5 生成 AWS 架构图质量惊艳,正做人机评审对齐 — amaarora · 2026-09-29
- 博主晒出疑似 Opus 5.5 注意力机制图表,未获官方证实 — Sauers_ · 2026-09-29
- Together AI 平台 Qwen3.8-Flash 全月 6 折,主打高并发编码助手场景 — togethercompute · 2026-09-29
- 传 Sonnet 5.5 发布即逼近 Opus 5.5,OpenAI Dev Day 被迫加码 — hibzy7 · 2026-09-29