ProgramBench 从二进制重建代码库,Claude Opus 5 完成率 4.5% 一骑绝尘
jyangballin · x · 2026-09-23
Meta Superintelligence Labs 联合斯坦福、哈佛发布新基准 ProgramBench:智能体只拿到编译后的二进制与文档,须从零架构并实现完整代码库以复现原程序行为,共 200 个任务,用隐藏行为测试判定是否完全解决。
榜单关键结果:
- Claude Opus 5 (xhigh):Resolved 4.5%、Almost 37.0%,断层第一
- GPT-5.6 Sol (xhigh):1.0% / 15.5%,第二
- GPT 5.5、Gemini 3.6 Flash 等几乎全部低于 1% Resolved;多数模型 Resolved 为 0
作者 jyangballin 补充:系统卡中 Opus 5.5 的多智能体运行显示,多智能体与单智能体可达相同结果但更快;不过榜单只用 166/200 任务,他强调难任务的长尾非常重要,鼓励跑满全部 200 题。
「模型」频道最新
- GPT-6 发布最大亮点是 Luna 价格砍半,正面叫板开源模型 — dbreunig · 2026-09-23
- 一日四发:GPT-6 Sol、Claude 5.5、Grok 4.7、小米 MiMo-V2.6 同天发布 — ivan_bezdomny · 2026-09-23
- scaling01 玩梗:今天肯定不会同时发布 Opus 5.5 和 Sol 吧 — scaling01 · 2026-09-23
- Claude Opus 5.5 SVG 演示流出,网友:RL 环境显然练过 — adonis_singh · 2026-09-23
- Delip Rao 从每月 200 美元降至 50 美元订阅,转向更多使用本地模型 — deliprao · 2026-09-23
- 他解释近 9 个月 AI 加速:Claude 4.5 触发窄域 RSI 与开源追平 — maksym_andr · 2026-09-23