SWEeper-Bench:测 AI agent 能否在用户发现前扫清按需软件的 bug

liuzhuang1234 · x · 2026-10-09

Tony Chen 提出:按需生成的交互式软件正成为人与 AI 交互的主流方式,但用户常沦为测试员——发现 bug、告诉 Claude、等修复、循环往复。

SWEeper-Bench 🧹 旨在衡量 agent 能否在这些 bug 被用户看到之前将其扫清。测试结果出人意料:Grok 4.6 表现最佳。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →