SWE-bench Science 发布,评测代码 Agent 解决科学软件工程任务能力

geoffwolfe · x · 2026-08-23

SWE-bench Science 是一个新的科学软件工程基准,包含来自 98 个 GitHub 仓库、20 个领域的 119 个任务,旨在测试编码代理解决科学领域工程问题的能力。评估显示,即使是表现最好的代理(Claude Code with Opus-5)的 pass@1 也低于 50%。研究分析了四种常见的失败机制:缺乏科学知识或抽象能力、探索或修复方向误导、修复覆盖不全或系统集成失败、以及科学知识泛化失败。消融实验表明,明确提供的科学知识并不总是有益的,需要对齐良好的指导才能提升性能。

所属事件:SWE-bench Science 发布,最强智能体通过率不足 50%(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →