真实用户短请求让七家模型SWE解决率平均掉6.4点

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

cs.AI, cs.LG, cs.SE

2026-08-28

RealSWE把SWE-bench改成381组可拆信息的变体:真实短请求让七家模型平均少解6.4个点;修bug写清期望行为能挽回约8个点,复现步骤几乎不加分。

这篇在解决什么

SWE-bench 家族用精修过的 GitHub issue 考 coding agent:篇幅长、结构完整,常常带着复现步骤、环境信息和期望行为。真人跟 agent 说话短得多,也随便得多。「empty input 会崩,修一下」这种句子,和一份写满模板字段的 issue,底层任务可以相同,agent 拿到的证据差一截。

成均馆大学用六类信息字段和四个语言维度,对照 SWE-chat 里 718 条真实用户首轮请求,以及 SWE-bench Verified 和 Pro 的题目。只带问题陈述、或再加一点边角信息(来源 URL、日期这类)的请求,占真实 prompt 的 88%,只占 benchmark 的 7%。语气上,87% 的真实请求是口语,94% 的 benchmark 题目是正式书面。修 bug 时,真实用户写出期望行为的只有 5.4%,benchmark 里是 73.5%。现有「更真实」的评测要么闭源(CursorBench),要么靠截断、注水来近似,没法单独拆开「缺了哪类信息」和「换了哪种口气」。

方法

RealSWE 把同一道可执行任务做成一组变体:gold patch 不变,只改信息组合和语言风格。管线分三步,主模型是 GPT-5.4:判定 bug fix 还是 feature request,按字段切开原题(不改写技术内容),再按 SWE-chat 里的多数风格改口吻,代码块、报错和路径原样保留。

1229 道原题里,403 道五个(bug)或三个(feature)字段齐全。两人各标 100 条,任务类型准确率 0.95;分解和改写再用 GPT-5.6 Terra 当 judge,和人的一致率分别是准确率 0.97 / 0.99。最低分的 22 道扔掉,剩下 381 组(192 修 bug,189 提需求)。入选集并不更简单:DeepSeek V4 Pro 在入选原题上 53.9%,被排除的 848 道是 63.0%,补丁也更大(中位 62 行对 38 行)。

对外两套产物。RealSWE-bench 按 SWE-chat 的字段分布各抽一个变体:修 bug 是 74% 纯问题陈述加 26% 问题+边角信息,提需求是 72% / 28%,共 381 题。平均题面 1417 字符,对着 SWE-chat 的 1427,短于 Verified / Pro / DeepSWE 的 1672 到 2776。RealSWE-framework 暴露全部变体,按任务类型、字段组合和口气点餐。

评测七家模型,统一 mini-SWE-agent v2、Bash-only、最多 100 步、每条件跑三遍:DeepSeek V4 Pro / Flash、MiMo V2.5 Pro / V2.5、Claude Haiku 4.5、Qwen3.7 Plus、MiniMax M3。

结果

七家在 RealSWE-bench 上全部掉分,平均 6.4 个百分点,相对各自原分掉 10.3% 到 16.2%(均值 13.6%)。

模型原题RealSWE差值
DeepSeek V4 Pro53.9%45.9%−8.0
DeepSeek V4 Flash49.7%41.6%−8.0
Qwen3.7 Plus50.1%43.5%−6.6
MiMo V2.5 Pro49.1%44.0%−5.1
MiMo V2.548.4%40.7%−7.7
Claude Haiku 4.542.1%36.7%−5.4
MiniMax M334.1%30.1%−4.0

排名会动。MiMo V2.5 Pro 从原题第四升到第二,超过 Qwen3.7 Plus 和 DeepSeek V4 Flash,MiMo–Qwen 的位差变化 +3.7 点(95% CI [+0.7, +7.3]),单题成本还大约便宜 2.5 倍(6.5 分对 16.1 分)。修 bug 平均掉 9.1 点,提需求只掉 3.7 点。六家成本和步数略升(成本平均 +6.2%,步数 +1.8%),多探索补不回丢掉的解决率。

字段消融把原因钉住了。口气几乎无关:信息齐全只改口吻,修 bug 平均 0.0 点、提需求 −1.8 点,八组对比无一显著。去掉复现步骤、环境、边角信息,平均只动 1.8 点。拿掉期望行为 [D],四家掉 7.1 到 8.9 点(平均 8.0,全部 Holm 校正 p<0.01)。提需求里拿掉动机 [M],平均掉 3.4 点,DeepSeek V4 Flash 掉 7.1 点。真实用户最爱交的 [P]/[PA],正好缺这两项高价值字段。

为什么重要

SWE-bench 排行榜按精修 issue 打分,会高估真实短请求下的表现,还会把用户推向更贵却未必更好的模型。这不是又一个「再难一点」的榜,是同一道题换通信方式。

对用户和产品的具体建议很窄:修 bug 写清「修好之后应该怎样」,提需求写清「为什么要这个」。复现步骤和环境信息在这条消融路径上几乎不加分,却占掉真实用户很少给、benchmark 很多给的篇幅。agent 侧可以在动手前问这两句,或从仓库里把它们补出来再开工。

局限与存疑

评测里没有 GPT-5.6、Opus 5、Kimi K3 这类当前 SWE 最强模型,结论对前沿系统未必同样成立。设定沿用 SWE-bench 的单轮:agent 不能追问,稀疏请求在真实多轮里可能没这么伤。入选要求字段齐全,从 1229 收到 381,作者给了难度和仓库分布对照,入选集并不更简单,但仍是原题的一个子集。字段切开和改写由 LLM 完成,人工只抽检;judge 和人的 macro-F1 在改写上只有 0.75。SWE-chat 过滤后剩 718 条首轮请求,代表的是「愿意跟 coding agent 说话的开发者」,不是所有工程师的 issue 习惯。

术语

原文与代码

相关论文

全部论文解读