SWE-Rebench:13个大模型与4个智能体在软件工程任务横评

ibragim_bad · hn · 2026-07-31

该项目对 13 个主流大语言模型和 4 个智能体在软件工程(SWE)任务上进行了基准测试,涵盖 Go、Java、Python、Rust 和 TypeScript 等多种编程语言,旨在评估它们在实际代码修复与开发任务中的表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →