ProgramBench 从二进制重建代码库,Claude Opus 5 完成率 4.5% 一骑绝尘

jyangballin · x · 2026-09-23

Meta Superintelligence Labs 联合斯坦福、哈佛发布新基准 ProgramBench:智能体只拿到编译后的二进制与文档,须从零架构并实现完整代码库以复现原程序行为,共 200 个任务,用隐藏行为测试判定是否完全解决。

榜单关键结果:

作者 jyangballin 补充:系统卡中 Opus 5.5 的多智能体运行显示,多智能体与单智能体可达相同结果但更快;不过榜单只用 166/200 任务,他强调难任务的长尾非常重要,鼓励跑满全部 200 题。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →