Meta Muse Spark 1.3 冲上 ProgramBench 第二,全部评测数据开源
jyangballin · x · 2026-09-30
ProgramBench 作者公布 Meta Muse Spark 1.3 的完整评测档案:在需从零编写 sqlite、ffmpeg、php 等完整程序的 SWE-agent 基准上,1.3 (max) 以 2.5% 完全解决率、25.0% 近似解决率排总榜第二,1.3 (xhigh) 排第三。
成本方面:max 档全程 API 花费 $1293、共 65,037 次模型调用,平均约 $6.5/题。语言分布上,C 项目 58% 的解被改写为 Python,Rust 项目 58% 仍用 Rust。作者同步开源了全部轨迹、最终代码库与测试通过明细。
所属事件:Meta Muse Spark 1.3 登 ProgramBench 第二并开源全部评测数据(2 条相关)→
「编程与Agent」频道最新
- NVIDIA 联手 Nous Research 详解 NeMo Relay 智能体追踪实践 — NVIDIAAI · 2026-10-01
- 模型写代码已够准:他主张删掉单元测试、取消代码评审仪式 — sanderssays · 2026-10-01
- Stack Overflow 推出 Stack Internal:把企业散落知识变成 AI 可信记忆 — pchandrasekar · 2026-10-01
- Code4Scene 基准:14 个 agent 在虚幻引擎里搭 3D 场景仍难过关 — Lianhuiq · 2026-10-01
- OpenRoboto 在 Bittensor 上办机器人智能竞赛,矿工接力改进共享基座模型 — markjeffrey · 2026-10-01
- Weco 见闻:Agent 改写判分代码看似作弊实为修 bug — victor_explore · 2026-10-01