SWE-bench Science 发布:最强智能体通过率也不到 50%

_akhaliq · x · 2026-08-21

新基准 SWE-bench Science 面向科学软件工程,包含 119 个任务,覆盖 98 个代码仓库和 20 个领域。结果显示即便是最强的智能体——使用 Opus-5 的 Claude Code——pass@1 也不到 50%,说明科学计算代码对现有编码智能体仍是明显短板。

所属事件:SWE-bench Science 发布,最强智能体通过率不足 50%(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →