字节推 SWE-Bench ProMax:多语言代码重构新基准
ByteDance · hf · 2026-08-11
字节跳动提出全新基准 SWE-Bench ProMax,旨在评估 AI 编程智能体在大型多语言代码重构任务上的能力。
- 背景:现有基准(如 SWE-bench Verified)正快速饱和,近期审查发现其近 60% 未解决实例的测试用例存在缺陷(如拒绝正确解或测试未声明需求),且前沿模型能直接复现训练集补丁。
- 基准特点:包含 170 个来自真实提交的实例,覆盖 Python、Java、TypeScript 等 7 种语言。所有实例均经过严格的多阶段人工校验,重写了精确的问题描述并审查了测试套件。
- 评估结果:任务规模庞大(平均每个实例需修改 11.4 个文件和 261.6 行代码)。在两种智能体框架下测试前沿模型,最佳模型解决率仅为 41.2%,证明该基准对现有 AI 编程智能体仍具挑战性且未饱和。
所属事件:字节推出多语言代码重构新基准 SWE-Bench ProMax(2 条相关)→
「编程与Agent」频道最新
- Abacus AI 发布 Smaug-Agentic:登顶开源智能体编码榜首 — bindureddy · 2026-08-11
- 自我进化编码智能体 Ouroboros 登顶多个基准测试 — Anton Razzhigaev · 2026-08-11
- 首个评估 LLM 自主优化框架能力的基准 Evo-Bench — RUC-AIBOX · 2026-08-11
- 告别 YAML:Cloudflare 推出基于 TypeScript 的 CI/CD 流水线 — irvinebroque · 2026-08-11
- OpenGoat:构建多AI智能体协作的开源框架 — tom_doerr · 2026-08-11
- Demo 已非瓶颈:AI Agent 正步入可靠性工程深水区 — Bladerunner_7_ · 2026-08-11