Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song
cs.CL
2026-08-11
这篇综述把智能体系统的「共同进化」(多个组件相互施加进化压力、彼此重塑)组织成一个渐进的三阶分类:智能体与智能体(对抗、协作、组织的同伴适应)、智能体与环境(任务、反馈、交互空间随智能体而变)、元共同进化(进化的「何时、如何、在哪、怎么评」机制本身可进化,通往开放性)。作者还讨论了动态评测、跨组件扩展和安全治理三类开放挑战。
智能体系统部署后还要能持续变强。单实体的自我进化(self-evolution)是一条主路,但它被静态的学习上下文束缚:固定任务、固定反馈。共同进化(co-evolution)走得更远,让多个组件相互施加进化压力、彼此重塑对方此后的进化轨迹,而不只是单纯交换信息或交互。尽管热度在涨,却没有任何一篇综述把共同进化当作中心轴线来梳理。这篇就来填这个空,回答三个问题:哪些组件在共同进化、进化的自由度边界怎么扩张、这过程的终极形态可能是什么。
作者用一个渐进的三阶分类来组织文献,分类轴是「系统被允许进化的范围」如何一步步挣脱人工设计的约束。形式化上,一个智能体系统 S=(A,E) 由智能体集合 A(每个智能体 a 由模型主干 m 和支架 h 组成,被角色、通信拓扑、分工 Π 组织起来)和环境 E 组成;Ω 是驱动状态转移的进化机制。
作为综述,「结果」是它梳理出的版图和趋势。几个清晰的脉络:共同进化的自由度边界沿「只智能体、到智能体加环境、到进化机制本身」逐级扩张,对应人工干预的逐步退场;从生物与博弈(对抗性自博弈)起源,迁移到语言智能体、课程生成、奖励适应;早期多为局部回路(攻击者与防御者、策略与奖励、智能体与任务生成)。作者明确指出,目前真正满足第三阶(元共同进化)定义的工作很少,大量讨论只能借用单实体的元进化做前驱,说明这些前驱能证明「进化机制本身可以进化」,但还没把它和一个下层共同进化系统耦合起来。
对研究者,这篇给了一个统一的概念框架:把分散在多智能体、课程学习、自我改进智能体、环境生成等子领域里的工作,用「进化自由度边界」这把尺子重新对齐,并明确划出共同进化与普通交互或信息交换的界限(必须相互重塑对方的后续进化)。它点出的方向也具体:未来不在更强的静态智能体,而在能持续通过共同进化改进的智能体,而这需要配套的动态评测和安全治理。对判断「自我改进、自我进化智能体」往哪走的从业者,三阶分类是现成的地图。
作者自己列了两条主要局限。一是元共同进化还处于极早期,满足其严格定义的工作有限,所以第三阶的论述大量依赖单实体元进化前驱,理论成分多于实证。二是安全与治理只停留在「期望」层面,没有给出具体的安全协议或机制:他们识别出共同进化系统特有的失效模式(评测器被钻空子、对同伴过拟合、多样性崩溃),但没有开发对应的防护。此外,作为综述,它必然受限于发表时点的文献覆盖;形式化框架(Ω、Γ)是组织工具,其预测力没有被单独验证。