优化器即 Agent,ReASearch 用一个推理型智能体统一优化提示词、程序和 ML 流程

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

COLM 2026

cs.AI

2026-08-07

把优化文本产物交给一个带工具的 code agent,它自己决定评估什么、怎么诊断、改哪、何时重启。14 个任务上比专用系统强 2% 到 40%。

这篇在解决什么

优化「文本产物」(系统提示词、程序、训练配置)是日常需求。现有做法大多靠外挂的搜索控制器:进化搜索、bandit、文本梯度、贝叶斯优化。LLM 在里面只当提议生成器,真正的搜索策略(选哪个候选、何时换方向、何时重启)是手写的,住在模型外面。

方法

ReASearch 是一个最小化的 code agent:文件读写、Python/Bash 执行、一个轻量记忆模块。每一轮它拿到系统提示和当前优化状态加上交互历史,自己推理下一步调哪个工具。核心循环与任务无关,所有任务相关信息只通过两个接口进入:工具集 + 任务专属系统提示。换任务只换工具和提示,同一套骨架就能优化提示词、程序、训练脚本。

其中 python exec 最关键,把 agent 从纯文本推理者变成「计算推理者」,能写分析脚本、算统计、定位失败模式。长程优化靠两个机制:上下文压缩(超过阈值就调压缩工具总结历史)和持久化的 lessons.md 文件(记下什么有效、什么没用、下一步试什么)。

结果

任务基线最强专用系统ReASearch
Terminal-Bench 2.0(提示词)35.6GEPA 42.253.3
ARC-AGI-2 测试(程序)AdaEvolve 12.5%50.0%
IMG-100(ML 流程)63.5Claude Code 78.684.0

提示词优化在四项上全超 GEPA;程序进化追平或超过 AdaEvolve,在 Circle Packing 的几个 n 上还改进了人类已知最好结果;ML 流程优化在五个任务里四个超过 Claude Code 的 AutoResearch(NanoGPT 上打平),并把一个 Kaggle 加密市场预测提交从第 36 名提到第 6 名。单次运行 API 成本不到 20 美元。

为什么重要

作者最想说的是:那些原本要手写的搜索行为(候选验证、假设驱动的诊断、何时回退、检测过拟合、跨轮积累教训)不需要外挂控制器,会从 agent 的推理过程里自然涌现。实际价值在于一个统一脚手架替换掉一堆专用优化器,而且更省 token。

局限与存疑

作者自己在附录 F 里承认,相对 Claude Code 的优势有一部分来自 harness 每轮把当前搜索状态(最好结果、近期实验、lessons、停滞告警)重新注入提示,而不只是指令本身。所以功劳有多少归 agent 的推理、多少归脚手架的编排,没有完全拆干净。对比面只有 GEPA、AdaEvolve、Claude Code,缺更广的基线。「涌现行为」大量来自作者对轨迹的定性复述,不是定量指标。20 美元一次的运行成本乘以 14 个任务和多次交叉验证,总量并不小。

术语

原文与代码

相关论文

全部论文解读