立场文把Agent当第三代软件,连续演化成功率从超80%掉到38%

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

Zhenfeng Cao

cs.SE, cs.AI

2026-06-04

这篇软件工程立场文主张Agent本身就是软件,决策逻辑在运行时生成。它没有新实验,最硬的数字来自引用:EvoClaw上孤立任务超过80%,连续演化最多38%。

这篇在解决什么

传统软件把决策写进静态代码,需求一变就要人去改 D。这篇立场文认为,LLM agent 把这件事换了:模型在运行时规划、写代码、调用工具,再把代码丢掉,持久下来的是 agent 的能力,不是那份中间产物。作者来自深圳一家投资机构,论证的是范式,不是新算法。中文圈讨论里有人把它读成「软件工程终结论」;正文自己写的是扩张定义,不是宣布学科死亡。

它要反对的实践是「AI → 软件 → 结果」:用模型帮人把传统系统写得更快,人仍在设计、集成、发布的关键路径上,最终交付物的复杂度天花板没动。

方法

形式化分两套元组。传统系统 S=(C, D, E),D 是人预先写死的确定性规则。Agent 系统 A=(模型, 工具, 记忆, 规划),逐步执行 at = M(st, 记忆),s{t+1} = exec(at)。代码在这里是推理的一次性工具。

复杂度论证用了一个上界:n 个组件全互连的拓扑数是 2 的 C(n,2) 次方,人的认知容量近似常数,所以传统路径在 N 超过人脑时经济上不可行;agent 把遍历交给随算力增长的模型。作者也写了,真实系统不会实现全部拓扑。交付史被写成三代:本地许可(复杂度在用户)、SaaS(在厂商)、AaaS(理解和决策也交给 agent,按结果收费)。Agentic Engineering 被说成学科扩张:核心对象从源码变成 agent 系统,人的角色从写代码变成意图架构、协调和审计。路线图分四段,从 2023–2025 的工具增强,到 2028 以后的自演化生态。

这些是定义和叙事,没有新的训练或评测协议。

结果

数字全部来自引用,不是作者跑的。

来源数字含义
Lingma SWE-GPT 72BSWE-bench Verified 30.20%接近当时 GPT-4o 的 31.80%
同系列 7B18.20%相对 Llama 3.1 405B 高 22.76% 相对幅度
LangChain 博客试点根因定位时间 -93%20 余个企业排障工作流,号称一个月省 200 工程小时
EvoClaw(12 个前沿模型 × 4 套框架)孤立任务 >80%,连续演化 ≤38%跨提交的持续演化,错误会累积

EvoClaw 那条悬崖被展开成四件事:上下文漂移、错误传播、不懂技术债、测试通过仍有语义漏洞。Hermes Agent 被写成带 Skills 自修补和子 agent 委派的生产系统,论文称其 GitHub star 超过 17.9 万。这些都是二手材料。

为什么重要

对从业者,有用的不是「软件被重新定义」这句口号,是孤立修 issue 和连续演化之间那 80% → 38% 的落差。今天能交给 agent 的,仍是成功标准清楚、范围封得住、已有测试的任务;仓库级长期维护还没有过关。人从写代码转向写意图、评测和治理,这个分工判断和多数团队的实际感受一致,也不需要接受那套渐近上界。

把它当系统设计论文会失望。没有新基准、没有消融、没有可复现的训练设置。LangChain 试点和 star 数不能当作对照实验。

局限与存疑

「第一性原理必然」过强。2^{C(n,2)} 是作者自己也承认未实现的上界,推不出 agent 是唯一出路;模块化、类型系统和形式化方法降低的是常数,论文把它们写成改变不了渐近,并没有证明。SWE-bench 30% 和一篇编排博客,撑不起「质变」。EvoClaw 的 38% 上限反而说明完全自主软件工程还差几年,这一点正文后半段是承认的,和开篇的必然性语气拧着。

经验部分几乎全是文献拼贴,引用了 Karpathy Software 2.0、ReAct、CoT、Wang 等人的 agent 综述、MetaGPT。投资机构作者、无会议审稿信息,读者应按立场文而不是按系统论文阅读。中文讨论里对「终结论」的批评,针对的是这类叙事的论证强度;就这篇文本而言,它至少没有在字面上宣布软件工程结束。

术语

原文与代码

社区讨论

相关论文

全部论文解读