ProgramBench 榜单:最抢手模型完整重建程序解决率仅 4.5%

jyangballin · x · 2026-09-29

来自 Meta Superintelligence Labs、斯坦福与哈佛的 ProgramBench 基准正式更新:给定编译后的二进制文件与文档,agent 需从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。

最新榜单亮点:

作者还给各模型页面加了语言热度图(GPT 最爱写 .py),并在首页排行榜加入了 $/task 成本维度。该基准显示:从二进制逆向重建完整程序对当前最强的编码模型仍是极难任务。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →