SWE-Bench ProMax 发布:专测大规模多语言代码重构
_akhaliq · x · 2026-08-11
研究人员发布了名为 SWE-Bench ProMax 的全新基准测试,专门用于评估 AI 编程智能体在处理大规模、多语言代码重构任务时的能力。该基准旨在提供比以往更复杂、更贴近真实企业级开发场景的评测标准。
所属事件:字节推出多语言代码重构新基准 SWE-Bench ProMax(2 条相关)→
「编程与Agent」频道最新
- Pydantic AI Harness v0.18.1 发布 — solyarisoftware · 2026-08-11
- 构建AI智能体:外部系统是最好的记忆 — goyalshaliniuk · 2026-08-11
- 不查代码不知道:前沿 AI 编程仍留下大量垃圾代码 — HankYeomans · 2026-08-11
- 华为提出 VDGR-RAG:融合向量与图谱的企业级智能问答 — _reachsumit · 2026-08-11
- MIT推Carnot引擎:让深度研究查询可视、可纠偏 — _reachsumit · 2026-08-11
- 优化深度研究智能体:轻量启发式算法可削减 73% Token — _reachsumit · 2026-08-11