单跑分数能差 6 个点:313 页专著把编码 Agent 当系统来修

Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

Stephanie Jarmak

cs.SE, cs.AI

2026-08-14

313 页专著把 164 篇学术工作汇编成 193 条门控实践:单跑 pass@1 波动可达 6 个点,许多「模型失败」出在模型之外的系统。

这篇在解决什么

编码 Agent 的评测和部署之间有条裂缝:评测按模型打分,部署按系统运行。生产环境里的 Agent 身边围着评测脚手架(harness)、执行沙箱、检索管线、状态存储、权限边界和人工审查界面,这些环节任何一处出错,表象都是「模型不行」。信誉塌方已经公开发生过:OpenAI 在 2026 年 2 月停报自己参与创建的 SWE-bench Verified,7 月又撤回对 SWE-bench Pro 的推荐,审计估计后者约 30% 的任务本身有问题。缺的是一套把模型能力和基础设施效应分开的方法。

方法

作者用多声文献综述(学术文献加实践者灰文献一起综合)汇编 164 篇学术工作、100 条实践记录、29 条 benchmark 记录和 17 个自运营系统案例,每条证据标四级:强、方向性、佐证、无效或冲突。产出是带稳定编号(ERCA-NNN)的目录,共 206 条可靠性记录:193 条通过准入门的实践,其中 56 条展开成章,另有 13 条研究线索。组织框架叫依赖链:任务构造、执行环境、检索、状态管理、验证、可观测性,任一环节的弱点都会让下游结论失效。第三部分把整套部署比作软件工厂,结论一句话:工厂而非工人持有可靠性承诺。Agent 是一次性工人,进度记录、故障恢复、外部效应的对账全归系统层。

结果

观察数字
6 万条 SWE-bench Verified 轨迹的单跑 pass@1 波动2.26.0 个百分点
温度设 0 后的标准差仍超 1.5 个百分点
Verified 138 个受审任务中测试有缺陷的比例59.4%,约合全集 16.4%
增强测试后重裁决,人工筛查套件被纠正的条目24.4%,连带改变 29 个排名
某模型的提交率对外部裁判认定的解决率100% 对 44%
多 agent 配置的 token 开销(SIMAS 研究)约 15 倍,辩论有时输给自我修正式的单 agent 方案

作者自己的复测最直观:某配置领先 0.054,重复三次后缩到 0.0035,置信区间跨零;原先贡献 0.300 优势的那个任务,复跑后两组都稳定在 0.800。系统对比里常见的 23 个点提升,恰好落在单跑波动包络之内。

为什么重要

对运营 Agent 的团队,这份专著给的是可执行的纪律。宣布配置间有差异之前先重复跑;逐任务配对比较,不比两个总分;每个公开分数配一套匹配的私有对照任务,量「公开-私有差距」;验收看执行结果,不看模型自报完成;计划文件、进度笔记、只追加的事件日志放在模型上下文之外,进程死了换一个工人接着干;决定影响范围(blast radius)的是权限和凭证,写在 prompt 里的警告不减少任何实际能力。每条实践都挂证据等级和失效边界,不是空泛建议。

局限与存疑

作者自己披露得很直白。最终裁定由单一作者完成,没有外部盲评,本版没有报告任何评审者间一致性;ACM 数字图书馆、IEEE Xplore、Scopus 三条检索因权限问题未执行,综述是结构化的、非穷尽的;实践者记录天然带选择偏差和幸存者偏差,Netflix 把部署损失从约 4% 降到 0.0001% 的案例是团队自报,只归为佐证级;第六部分是从调度文献借来的研究议程,不是部署结论。52 条实践的紧迫度排名与是否带强证据的相关系数为 -0.004,作者拿这个数字承认章节选择是工程判断。

术语

原文与代码

社区讨论

相关论文

全部论文解读