SWE-sweep 新基准:考模型能否在用户踩坑前主动找出 bug
klieret · reddit · 2026-10-02
Meta、Stanford、Harvard、UW 研究者联合推出新基准 SWE-sweep,思路与主流 SWE 基准相反:不再让模型修用户已遇到的 bug,而是把一个大型真实代码库交给 agent,让它在隐藏的真实 bug 集上尽量多地找出并修复。
- 所有 bug 均来自真实世界,按隐藏 bug 集打分
- 一个反直觉发现:Luna xhigh 的性价比极高,用极小的成本拿到约一半于 Sol 的分数,明显优于受测的 Anthropic 模型
- 完整排行榜与构建方法见 swesweep.com,配套论文说明基准构造细节
所属事件:Meta 等机构发布 SWE-sweep:最强模型无监督找 bug 仅修 4.7%(6 条相关)→
「编程与Agent」频道最新
- 资深开发者:AI 擅长写代码造资产,却做不好游戏手感设计 — rms80 · 2026-10-03
- 免费 AI Agent 学习路线:一天四级从入门到 MCP 与安全 — ifioknkem · 2026-10-03
- 用 Swift 调用 System One 模型:毫秒级确定性决策,成本远低于 LLM — rxwei · 2026-10-03
- 一条全局规则并行跑 50 个 AI agent:后台任务流工作流分享 — Daniel_Farinax · 2026-10-03
- 为何 Linear Agent Session 比 Slack 更适合智能体协作 — jeff_weinstein · 2026-10-03
- SWE-chat 数据集发布 V2:规模扩大 3.5 倍并加入子智能体轨迹 — Diyi_Yang · 2026-10-03