Ofir Press 回应 bug 基准争议:训练该行为可取,但不许刷测试集
OfirPress · x · 2026-10-03
Ofir Press(SWE-bench 团队)在回复 Lucas 的质疑时,就新 bug 发现基准(SWE-sweep)的潜在问题作出两点回应:
- 针对「模型是否会从基准行为泛化到真实找 bug 能力」的担忧:团队在论文中讨论了这些潜在陷阱,并做了若干实验,显示模型在一般场景下找 bug 的能力与在该基准上的表现存在相关性。
- 针对「大家会不会针对基准训练」的担忧:他认为针对这类行为训练是好事——正如 SWE-bench 当年鼓励模型训练以提升该能力一样——只要不直接在测试集上训练即可,并希望社区照此让模型变得更强。
「编程与Agent」频道最新
- 资深工程师:Agent 让写码可单人完成,做产品反而更依赖团队 — bendee983 · 2026-10-03
- 嫌 $300/年订阅太复杂,他用 Claude 5 分钟复刻核心功能 — petergyang · 2026-10-03
- 让 Dots 搭建状态页复盘:不用 Firecrawl,靠手写 HTTP 与解析器 — edwin · 2026-10-03
- 重复 8 次让 OpenAI Dots 搭 AI 状态仪表盘,不许指定技术栈 — edwin · 2026-10-03
- 前 Meta 产品总监开免费课:复制他的个人 AI 幕僚系统 — petergyang · 2026-10-03
- 六周 Claude Code 与 Codex 营销课程免费开源,含 18 小时全部转录 — alexgoughcooper · 2026-10-03