SWE-bench Science 发布:测评智能体修复科学软件能力
OpenMOSS-Team · hf · 2026-08-21
OpenMOSS-Team 推出了 SWE-bench Science,这是一个用于评估编程智能体解决科学软件工程任务能力的基准测试。该基准测试揭示了智能体在科学软件修复方面的失败机制,以及科学指导对任务效果产生的复杂影响。
「编程与Agent」频道最新
- MiniMax 推出 Design 客户端:Agent 全流程出片,H3 视频低至 0.4 元/秒 — xiaohu · 2026-08-21
- AI 应用如何上生产?实战演练 OpenTelemetry 与值班 Agent — Al_Grigor · 2026-08-21
- 实测让 AI Agent 一条指令做出整套亚马逊 listing — kaisun000000 · 2026-08-21
- 上线 AI Agent 前该想清楚的五件事:能否行动、何时止损 — hubtyper · 2026-08-21
- 展示 Anthropic Computer Use 与 Codex 结合 — gabrielchua · 2026-08-21
- 微软 9 月 9 日举办 MCP Live 线上活动 — lee_stott · 2026-08-21