A Few Pages of Markdown: Committed AI Configuration and Lower Quality Cost after Coding-Agent Adoption
Yegor Denisov-Blanch, Shyam Agarwal, Pavel Azaletskiy, Hao He, Rylan Schaeffer, Brando Miranda, Bogdan Vasilescu, Sanmi Koyejo
cs.SE, cs.AI
2026-08-26
RAMP 把仓库里提交的 AI 配置分成四级成熟度。Agent 无论哪一级都加快提交(约 28% 到 38%),但没配置的仓库认知复杂度涨 52.7%,有配置的只涨 26.7%。
编码 Agent 让部分团队明显变快,也让另一部分团队觉得产出是 slop,评审和维护被拖住。既有研究给出的是采纳者平均值:速度短期上升,静态警告和复杂度长期变差。平均值盖住了团队之间的差别。缺的是一个能在仓库尺度观察、并且能和代码质量结果对齐的实践度量。
咨询公司和软件工程研究所最近一年出过不少 AI 成熟度模型,多数靠组织问卷。质量是代码库的属性,实践也必须在同一单位上量。很多采纳已经发生,测量只能来自团队留在版本库里的东西。
RAMP(Repository AI Maturity Profile)是四级累积模型,级别等于仓库里出现过的最高类工件:L1 无提交配置;L2 行为规则、工具设置、架构说明、编码规范;L3 具名 agent、可复用命令、技能文档;L4 多 agent 编排和工作流。分类管线覆盖 12 种工具的路径模式,再用 nomic-embed-text-v1.5 对路径和文件内容做语义分类,九类模板映射到四级。
模型在 27 家公司的 441 个私有仓库上开发,Guttman 可重复性系数 0.997。三人在 Study 2 语料的 35 个仓库、195 个工件上盲标,仓库级标签 34/35(97.1%)一致。Study 1 看 196 个采纳者约 14 个月的迁移。Study 2 把冻结分类器打到 Agarwal 等人的开源 Agent 采纳面板,509 个可追溯处理组按 L1 对 L2+ 分层,在 agent-first 层内重跑交错双重差分。
441 个开发样本里,66.7% 停在 L1,24.7% 在 L2,8.6% 在 L3,L4 为零。规则文件几乎是标配:L2 的 98.2%、L3 的 84.2% 有一份。采纳基本是一次性、只向前、写完不管:73.8% 的工件提交一次后再不改;95.9% 的采纳者从 L2 进入;逆转 0%。从无配置到第一份工件的中位等待至少 441 天,L2 到 L3 若发生则中位 154 天。
Study 2 的处理组 236 个 L1、273 个 L2+(含 40 个开源 L4)。agent-first 层里速度两边都升:提交 +37.6%(L1)对 +27.5%(L2+),加行 +48.1% 对 +68.7%。质量分开走。
| 指标(agent-first) | L1 无配置 | L2+ 有配置 | 比值 |
| 认知复杂度 | +52.70% | +26.68% | 2.0× |
| 静态分析警告 | +24.08% | +14.04% | 1.7× |
| 重复行密度 | +15.44% | +14.23% | 1.1× |
| 月提交 | +37.56% | +27.52% | 1.4× |
He 等人对 Cursor 采纳者报过警告 +30%、复杂度 +41%。L2+ 落在两条基线之下;L1 的复杂度超过该基线。警告的事前系数偏高,识别弱于复杂度。作者把 Study 2 明确写成假设生成,不是因果。
对已经或准备让 Agent 写生产代码的团队,这篇给出一个便宜的分层工具:看仓库里有没有提交过行为规则和标准。速度增益两边都有,质量代价主要落在什么都不提交的仓库。L2+ 并没有把复杂度涨幅消掉,仍有显著的 26.7%。成熟度量的是工件存在,不是内容质量或执行力度。关联可能混进工程纪律或模型能力;RAMP 的用处是让后续研究按「怎么配置」而不是按「有没有采纳」来抽样。
成熟度在面板期末快照上打标,agent-first 层里只有 3.8% 的 L2+ 仓库在采纳月之前提交过第一份有效工件,逆向因果(质量变差之后才去写配置)会压低差距。L2+ 仓库星标和活跃度高得多,共享对照池不保证层内协变量平衡。IDE-first 的 L1 只有 22 个仓库,对比几乎只在 agent-first 里识别。开发样本无 L4,四级主张靠映射置换和流行度排序补。标注者间一致性中等(Krippendorff α=0.572)。结果是 SonarQube 代理,不是缺陷。