SWE-bench Science 发布:最强智能体通过率也不到 50%
_akhaliq · x · 2026-08-21
新基准 SWE-bench Science 面向科学软件工程,包含 119 个任务,覆盖 98 个代码仓库和 20 个领域。结果显示即便是最强的智能体——使用 Opus-5 的 Claude Code——pass@1 也不到 50%,说明科学计算代码对现有编码智能体仍是明显短板。
所属事件:SWE-bench Science 发布,最强智能体通过率不足 50%(3 条相关)→
「编程与Agent」频道最新
- 实测:Terra 胜过 Sonnet,Flash 速度质量无敌 — cgarciae88 · 2026-08-23
- 让 AI Agent 担当运维第一响应者? — AustinZHenley · 2026-08-23
- YC 项目 Archal 上线:给 AI Agent 用的有状态 API 测试沙箱 — Scobleizer · 2026-08-23
- Agent 构建日回顾:利用一年追踪数据推荐用户 — agihouse_org · 2026-08-23
- 在 Scrum 中用 AI 代理充当 SM 和 PO 盯质量 — JoeJustice · 2026-08-23
- 实测开源 Traycer:让 Claude Code 与 Codex 共享工作区协作写码 — WorldofAI · 2026-08-23