SWE-bench Science 发布,评测代码 Agent 解决科学软件工程任务能力
geoffwolfe · x · 2026-08-23
SWE-bench Science 是一个新的科学软件工程基准,包含来自 98 个 GitHub 仓库、20 个领域的 119 个任务,旨在测试编码代理解决科学领域工程问题的能力。评估显示,即使是表现最好的代理(Claude Code with Opus-5)的 pass@1 也低于 50%。研究分析了四种常见的失败机制:缺乏科学知识或抽象能力、探索或修复方向误导、修复覆盖不全或系统集成失败、以及科学知识泛化失败。消融实验表明,明确提供的科学知识并不总是有益的,需要对齐良好的指导才能提升性能。
所属事件:SWE-bench Science 发布,最强智能体通过率不足 50%(3 条相关)→
「编程与Agent」频道最新
- Claude 推出 Computer Use 与 Skills API,Agent 正式支持操作软件 — krishnan · 2026-08-23
- ThoughtDAG:本地 LLM 的无限画布与显式上下文管理 — Lopsided_Scarcity979 · 2026-08-23
- 逆向 Claude Code 代理通信,开发者发布互通 CLI 工具 — KirkNewcombe · 2026-08-23
- 求助:如何在 ComfyUI 工作流中实现人脸数量检测循环 — Scardra · 2026-08-23
- Mercury 开源 132 个 AI 编程 Agent 技能库 — tom_doerr · 2026-08-23
- 实测 ChatGPT 插件一键汇总 40 网页,变身为多会话编排器 — koltregaskes · 2026-08-23