SWE-bench Science 发布:测评智能体修复科学软件能力

OpenMOSS-Team · hf · 2026-08-21

OpenMOSS-Team 推出了 SWE-bench Science,这是一个用于评估编程智能体解决科学软件工程任务能力的基准测试。该基准测试揭示了智能体在科学软件修复方面的失败机制,以及科学指导对任务效果产生的复杂影响。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →