SWE-Rebench:13个大模型与4个智能体在软件工程任务横评
ibragim_bad · hn · 2026-07-31
该项目对 13 个主流大语言模型和 4 个智能体在软件工程(SWE)任务上进行了基准测试,涵盖 Go、Java、Python、Rust 和 TypeScript 等多种编程语言,旨在评估它们在实际代码修复与开发任务中的表现。
「编程与Agent」频道最新
- Plannator 发布技能:用 HTML 生成 Agent 交互原型 — tom_doerr · 2026-08-24
- DocketBird MCP 服务器:支持搜索下载法院文档 — modelcontextprotocol · 2026-08-24
- AgentLux MCP 服务器:支持市场和社交流程 — modelcontextprotocol · 2026-08-24
- MongoDB 发布 Agent 工具包,让编码助手精通数据库 — TheTuringPost · 2026-08-24
- 开发软件前先让 Agent 查开源库,99% 的情况是正解 — generativist · 2026-08-24
- 开发者瓶颈不在 AI 上下文,而在人脑认知负荷 — Vidhrohi · 2026-08-24