SchrödingerRepo:动态改写仓库揭示 SWE-bench 记忆化问题
SJTU · hf · 2026-09-24
上海交大团队提出 SchrödingerRepo 评测框架,质疑 LLM 在 SWE-bench 上的表现可能源于对热门开源仓库的记忆而非真实的仓库推理。核心思路是把测试仓库视为评测时才动态实例化的潜变量,在保留可执行行为的前提下通过四级变换侵蚀熟悉线索:问题重述、命名空间重映射、文件内布局重排、保持功能的代码重写。
在 SWE-bench Verified 和 SWE-QA 上的实验显示:
- 移除熟悉仓库线索后,各主流模型性能一致下降,交互成本显著上升
- 额外成本主要来自仓库探索与定位难度的增加
结论:当前编码智能体可能部分依赖记忆的仓库侧线索,需要在动态实例化的仓库表示下评测。
「编程与Agent」频道最新
- 作者开源笔刷动画工作流:用 Claude 做出更高质量动画 — alejandroll10 · 2026-09-24
- Opus 5.5 纯代码搞定 Blender 建模绑定,作者封装成首个开发 skill — TAbrodi · 2026-09-24
- 一条 prompt 让 agent 自己核算账单:价格涨还是用量涨? — gethackteam · 2026-09-24
- Opus 5.5 单条 prompt 一次生成 C/C++ 版 90 年代 demoscene 演示 — dreamwieber · 2026-09-24
- 用 Sonnet 3.7 起步、Opus 5.5 重构:AI 生成 Rummy 500 游戏免费上线 — AIandDesign · 2026-09-24
- Garry Tan:创业公司获客正被 agent 双向重塑 — garrytan · 2026-09-24