SWE-sweep 基准代码开源:facebookresearch 仓库可直接复现评测
OfirPress · x · 2026-10-02
SWE-sweep 基准的代码已在 GitHub 开源(facebookresearch/swe-sweep)。该项目是 Harbor 的轻量封装,agent 在真实仓库中自主发现并修复 bug,不获任何提示。仓库含评测任务、自动验证环境与最终分数的微平均计算方式,README 提示需使用 Harbor 特定版本(0.23 尚不支持其独立验证环境,需锁定源码修订版)。
所属事件:SWE-sweep 基准出炉:最强模型自主修 bug 不足 5%(3 条相关)→
「研究」频道最新
- Tacit-TTS:免转写零样本声音克隆,比 IndexTTS2 快 10 倍 — Jian Chen · 2026-10-02
- 字节 Seed 提出 RWTD:一步生成模型后训练,GenEval 0.73→0.80 — ByteDance-Seed · 2026-10-02
- 亚马逊新方法:用熵移位掩码自蒸馏训练 LLM 评审,超 GRPO 2-9 个点 — amazon · 2026-10-02
- 开源 mhctools 一个 predict() 调用统一十余个免疫预测器 — iskander · 2026-10-02
- Quail 团队用 roofline 模型估算 AI-SQL 延迟:5k 条评论过滤下限仅 6.6 秒 — sh_reya · 2026-10-02
- Nature 开放同行评审竟带涂黑,研究者群嘲"再收 1.6 万美元" — anshulkundaje · 2026-10-02