PawelHuryn 指出 DeepSWE 局限:单一容器任务测不出真实世界回归
PawelHuryn · x · 2026-10-09
- PawelHuryn 承接其关于 DeepSWE 评测的批评:agent 写的测试从未在第二次改动中被运行,grader 也不执行它们,因此评测无法证明 agent 能在后续改动中防住回归。
- 他强调 DeepSWE 仓库是自包含库,每个任务在无网络、无 UI 的单个 Linux 容器中运行。
- 而真实工程中的回归形态完全不同:不可见的登录链接、破坏老版本用户的改动、只在单一 OS 上出现的 bug——这些 DeepSWE 都无法复现。
所属事件:社区激辩 agent 编码评测能否测出回归(3 条相关)→
「编程与Agent」频道最新
- 两周产 23 条广告 100 个版本:AI 视频制作工作流的 10 项实战复盘 — justin_hart · 2026-10-09
- 支持 120 国号码接入,独立开发者重构 AI 电话平台摆脱 Twilio — redouanea · 2026-10-09
- Git 挑战第 5-6 天:多智能体「组织架构」频崩,调试组织成主任务 — Al_Grigor · 2026-10-09
- 开发者感慨:未来孩子难以理解当年要手动打断点调试代码 — eherrerosj · 2026-10-09
- 用户撤销权限后 Codex 仍可读写旧文件夹,且官方无法解释 — Some-Following-392 · 2026-10-09
- OpenAI Live API可用session.instructions.append实时转向 — juberti · 2026-10-09