SWE-Race 基准发布:188 个真实并发 bug,GPT-5.6 Luna 硬题仅 23%
heyitsdannyle · reddit · 2026-10-06
团队发布了 SWE-Race,一个基于真实并发缺陷的编码 agent 基准:任务取自约 100 个 Python 项目的已合并 PR,涵盖竞态、死锁、取消问题等,共 188 个 bug,用项目自身测试在无网络容器中评分,仓库被裁剪到单 commit 以防 agent 从 git 历史找回修复。主要发现:
- 单次尝试成绩:GLM-5.3 Flash 85%,GPT-5.6 Luna 81%;基准现在公开每次尝试次数与置信区间
- 难度分层:约一半任务所有模型接近满分;另一半难题上三家模型分别为 50%、45%、23%,模型差距主要来自难题
- 污染检查:审查了 agent 运行的全部 1.1 万条命令,69 次尝试联网均失败;GLM 曾 50 次尝试 pip 下载已修复的库版本
- 数据污染:2026 年前的旧 bug 解答率高约 9 分,但置信区间跨零,尚无法定论;一半任务保持私有,公开/私有分数目前一致
协议遵循 DeepSWE(100 步上限),任务已发布在 Hugging Face,所有 agent 运行记录公开。
「编程与Agent」频道最新
- Matt Pocock:把 AI 编码技能定制成你自己的工作流 — mattpocockuk · 2026-10-06
- 斯坦福 ACE 团队推出 Sentry:失败知识常驻上下文反而拖累 Agent — StanfordAILab · 2026-10-06
- 防 Claude 封号:Shadowrocket 七步 TUN 配置堵漏指南 — aigclink · 2026-10-06
- ChatGPT 插件提交流程简化:上传 zip 即可送审 — Dimillian · 2026-10-06
- 一个工具搞定抓取+提取:开发者实战解决 Agent 上下文溢出 — OkShirt9372 · 2026-10-06
- 跑了几十小时端到端基准,Strata 推理服务器在完整构建任务上翻车 — julianharris · 2026-10-06