Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence
Yuyuan Feng, Zhishang Xiang, Chaobin Yang, Qichao Ma, Zerui Chen, Yujing Zhang, Ke Huang, Chuanjie Wu, Zhaoxu Liu, Yili Wang, Xin He, Jiapu Wang, Zijin Hong, Hao Chen, Yuanchen Bei, Kun Wang, Shengyuan Chen, Ningyu Zhang, Enyan Dai, Linhao Luo, Qingyi Pan, Qi Wang, Wenqi Fan, Guangjing Wang, Na Zou, Yangqiu Song, Xin Wang, Zechao Li, Xia Hu, Qing Li, Xiao Huang, Zhihong Zhang, Jinsong Su, Qinggang Zhang, Yi Chang
cs.IR, cs.AI, cs.ET
2026-08-21
吉林大学等把 Prompt、Context、Harness、Loop 之后的下一层定为 Graph Engineering:用图显式组织任务依赖、异构协作和运行时状态,系统智能不再等于多几个 Agent。
Prompt Engineering 管怎么说话,Context Engineering 管塞什么信息,Harness Engineering 把工具、记忆、技能接到模型外面,Loop Engineering 把感知、行动、反馈收成一条可持续循环。这条线把大模型从一次生成推到了单个 Agent 能自己干活。
单循环装不下真正复杂的活。软件排障里日志分析、故障复现、代码排查可以并行,修代码和测试又互相依赖;科研发现里文献、实验、实现、独立验证要异构专长,还要有人专门唱反调。全塞进一个 Agent 的上下文,并行被压成串行,中间错了很难定位,写代码的和评代码的还是同一个人。这篇综述把缺口命名为 System Intelligence:系统把多个智能部件组织成一个能追共同目标的整体。关键不在再加几个 Agent,而在把任务、协作、状态写成可调度的结构。
作者提出 Graph Engineering,把图从「增强某项能力的表示」升成系统的组织底座,拆成三张互相耦合的图。
第四块 System Evolution 用执行证据回头改这三张图:任务结构看 TDAG 和 EvoFlow,团队与通信看 SwarmAgentic 和 AgentNet,状态沉淀为可复用经验。作者把下一层留给 Ontology Engineering:图能把关系画出来,但不能保证各 Agent 对「完成」「证据」「授权」的理解一致。
这是综述,没有新的 SOTA 数字。硬产出是一套分层工程史,以及一张和其他综述的覆盖对照。Prompt 与 Context 归到 Model Intelligence,Harness 与 Loop 归到 Individual Intelligence,Graph 归到 System Intelligence。附录对照里,多数 Agent 综述覆盖规划或 MAS,Harness 与 Loop 只是次要提及;Harness 专项综述覆盖运行时,但不把图当系统底座;最接近的动态图演化综述问的是 Agent 如何用图变换来自我演化,这篇问的是系统智能如何被组织。作者自己那一行在 Harness、Loop、Planning、Workflow、MAS、State、Self-Evolution、Ontology 上全部打了主轴标记,这是自我定位,不是实证。
应用一章跨软件工程、科研、医疗、企业流程、通用数字 Agent、社会经济仿真。跨域判断很具体:工作拆解和团队编排已经常见,运行时状态管理正在出现,持久的系统级演化仍然少见。多数系统在预定义结构里自适应执行,不会根据积累证据永久改组织。作者把「图结构的」和「图工程的」分开:当代系统越来越多地通过显式工作、团队、状态结构来执行,这些结构通常仍由人手选定、在执行前定死。
评测资源按三个智能层级重排。系统层不再用 MMLU 这类单次问答,而用 TaskBench、WorFBench 看工作图,MultiAgentBench、VillagerBench 看协作,SyncBench、Who & When 看状态与归因。三个评测缺口写得很硬:系统增益和更强模型、更长上下文、更多重试分不开;工作、协作、状态、演化的评测互相碎片化;结构归因和动态评测仍然弱。
给做 Agent 产品的人一个更硬的判断框架。今天堆 subagent、并行 worktree、任务看板,很容易自我感觉已经在做系统智能。按这篇的口径,那只是图结构的,还不是图工程的:缺结构目标、图级可观测、受控变异和跨任务迁移证据。
可直接用的部分是那三张图的检查清单。并行依赖有没有显式化,写和评有没有拆开,失败能不能回溯到具体 Agent 和步骤。这些比换一个更强的基座模型更接近系统层问题。渐进之处也清楚:这是命名和编目,不是新算法。配套仓库收集了论文、数据和开源项目,方便按图检索,不替代读原文。
作者自己承认图只解决结构显式化,解决不了语义一致、目标形成和价值对齐。开放挑战还列了能力底座仍是散装服务、隐私伦理、评测分不清系统贡献和算力贡献。
作为综述,选择性偏差几乎必然。叙事主线强,但「Graph Engineering 是下一个工程范式」是作者的组织主张,文献并没有在这个名字下收敛。覆盖对照表由作者填写,把自己标成唯一全覆盖,说服力有限。应用章的「演化仍然少见」来自定性阅读,没有给出可复核的统计。Awesome 仓库收集了论文和项目,综述本身不附可复现实验。