CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems
Yingtao Tian
cs.AI
2026-08-07
Sakana 的 CEDAR 用 LLM Editor 改系统代码、Judge 打分,套在 MCTS 上按自然语言目标搜索复杂系统;不给公式也跑赢喂了完整真值公式的 Optuna。
复杂系统(complex system)用非线性、带反馈的方程描述世界:人口、资源、污染怎么此消彼长,疫情怎么扩散,一项政策会逼出什么后果。这类系统的麻烦在于,结构(谁影响谁、反馈怎么绕)和它最终涌现出的行为之间的关系极难预测,所以「按一个目标去设计一个系统」几乎是人工生命领域公认的开放难题。再加上传统建模范式(DYNAMO、STELLA 这类专用语言)依赖专家手写,工作流重、上手门槛高,复杂系统方法在很多本该有用的领域迟迟推不开。
CEDAR(Complex-systems Exploration and Design via Agent-Orchestrated Refinement)把这件事重写成两个 LLM 智能体驱动的蒙特卡洛树搜索(MCTS)。系统本身被表示成一段可运行的受限 Python 子集,带领域专用原语,LLM 可以直接改它的动力学代码。每一轮:MCTS 选一个候选系统节点展开;LLM Editor 充当变异算子,按一套策略(突破、激进、放大、保守等八种)提出改写后的新系统;新系统真跑一遍;LLM Judge 充当适应度函数,对照自然语言目标给分并写一段分析。这等于把演化计算里的「生成—评估」循环接到了树搜索上,搜索树充当结构化的候选种群,Judge 给适应度,Editor 做变异。因为走的是树而不是收敛到单点,天然保留了多种解。
论文展开两类对照。第一类是拟合一条具体的目标轨迹(一个带随机性的种群增长模型),和黑盒优化器 Optuna 比,而且故意偏袒基线:给 Optuna 100 次试验,最强的一档还直接喂进完整真值公式。
| 方法 | 给的公式 | L1 ↓ | DTW ↓ |
| Optuna | 无 | 29.06 | 5503.68 |
| Optuna | 简化版 | 26.01 | 4927.94 |
| Optuna | 完整真值 | 3.71 | 477.52 |
| CEDAR(Claude) | 无 | 3.29 | 757.21 |
| CEDAR(GPT-5.1) | 无 | 2.22 | 433.13 |
CEDAR 只拿到一个最简骨架、没有任何公式,误差反而低于喂了完整公式的 Optuna。第二类是用自然语言目标优化经典的 World Dynamics 模型(同时要人口涨、资源省、污染少),CEDAR 找到多套结构上完全不同、却都达标的高分系统;不同后端还各有偏好,Claude 偏向人口,GPT-5.1 偏向资源。消融显示 MCTS 比线性搜索得分更高、轨迹更平滑,还能避免那种过拟合到一个点的塌缩。单次搜索约 100 次展开,跑一次 30 分钟、10 到 50 美元。
复杂系统建模过去基本是专家手艺活,CEDAR 把「照着一个模糊的自然语言目标,自动搜出能达标的系统」做成了可重复的流程。对做系统动力学、人工生命、政策模拟的人,它降低了搭建和调试模型的门槛,而且因为树搜索保留了多种解,方便做敏感性分析。这更接近「降低门槛加上打开新能力」,不是在某个已有榜单上抠零点几个点。
作者自己点了几条。最大的循环风险:LLM Judge 既给分,又和 Editor 同属一类模型,在「模糊自然语言目标」这个最核心的设定里,评价标准本身没被外部锚定,存在自评自赏的可能。论文也只报告趋势,没给严格统计检验。深入实验集中在两个系统上,缺和经典演化算法、多目标优化的系统对照,什么时候必须用 LLM 变异和评价、什么时候传统方法就够,目前还说不清。