Meta/斯坦福/哈佛联合开源 ProgramBench 排行榜,社区可提交自测结果
jyangballin · x · 2026-09-30
ProgramBench(由 Meta Superintelligence Labs、斯坦福和哈佛联合推进)上线社区排行榜并全面开源:所有轨迹、最终代码库、测试通过/失败明细都已公开,并开放了 Muse Spark 1.3 的评测档案和其生成的代码库下载。
- 提交方式:用 uvx programbench(或 pip)运行评测,结果打包成含 submission.yaml、逐任务轨迹与 eval 结果的公开 GitHub 仓库;大文件可上传 HuggingFace dataset;
- 流程:提交 PR 到 ProgramBench/submissions 注册表,合并后即出现在排行榜上;
- 官方以 Gemini 3.1 Pro + mini-SWE-agent 基线作为示例提交;
- 作者预告更多模型即将加入:6 astra、5.5 opus,并邀请社区提名,提交通道已开放,可跑自己的模型或 harness。
「编程与Agent」频道最新
- 模型写代码已够准:他主张删掉单元测试、取消代码评审仪式 — sanderssays · 2026-10-01
- Stack Overflow 推出 Stack Internal:把企业散落知识变成 AI 可信记忆 — pchandrasekar · 2026-10-01
- Code4Scene 基准:14 个 agent 在虚幻引擎里搭 3D 场景仍难过关 — Lianhuiq · 2026-10-01
- OpenRoboto 在 Bittensor 上办机器人智能竞赛,矿工接力改进共享基座模型 — markjeffrey · 2026-10-01
- Weco 见闻:Agent 改写判分代码看似作弊实为修 bug — victor_explore · 2026-10-01
- 实拍 AI agent 管财务付款:预算不够自动分期、超限上报、防重复打款 — kimmonismus · 2026-10-01