SWE-bench Science 发布,最强智能体通过率不足 50%

OpenMOSS-Team 发布新基准 SWE-bench Science,用于评测编码智能体解决科学软件工程任务的能力。该基准包含 119 个任务,来自 98 个 GitHub 仓库、覆盖 20 个领域。测试结果显示,即便是最强的智能体通过率也不到 50%,揭示了当前智能体在科学软件修复方面的明显短板。

2026-08-21 ~ 2026-08-23 · 3 条相关