只有笼统目标时,24次自学里仅3个终检超过指令微调基线

Aspire: Can Models Self-Evolve from Vague Goals?

Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang

cs.CL

2026-09-01

Aspire只给笼统能力目标,藏起520道专家题。终局协议12对里仅科学一项Avg@2高于基线;自适应30格只保住一次4B数学从17.86到20.10。最强后继harness仍低于Qwen-Agent的28.64。

这篇在解决什么

人学物理、学做研究,起点往往是一句含糊目标,而不是一张现成考卷。学习者得自己判断缺什么、拿什么材料练、怎样算真的进步。现有 LLM 自我进化几乎都从 PostTrainBench 这类设定出发:任务、脚本、指标已经替模型想好,搜索空间只剩「怎么优化」,没有「优化什么」。

Aspire 把目标操作化单独拿出来考。Agent 只拿到一句自然语言能力目标,下游题目全程封存。它必须自己选数据、选 SFT 或 GRPO、造验证信号、决定何时停。测的是能力方向有没有真涨,不是代理集上的自嗨。

方法

六个目标对应 520 道专家从零撰写的隐藏题:科学学术推理 75、人文社科 110、医学 100、数学 126、逻辑与指令遵循 89、学术写作 20。GPQA、MMLU-Pro、MedQA 只当题型和难度参照,原题不进集。训练数据会做重叠审计。协议要么只给有限次总分,要么终局才打一次分,从不见题目和逐题对错。

交互被收成一个带类型的工具:搜和注册数据、启动 LoRA SFT 或 GRPO、查作业、在自建验证集上打分、分支或终止。控制器管凭证、调度和检查点校验。权重进化改模型、固定 harness;harness 进化改提示、工具策略和工作流、固定权重。分数门控下,选中检查点必须高于入口分才保留,否则回滚,所以保留增益一定非负,那是选择规则,不是每次更新都在变强。

RQ1 把 PostTrainBench 的基准名换成笼统能力描述,原封评价器不动。RQ2 从指令微调检查点出发做权重搜索。RQ3 固定 Qwen3.5-4B,让不同决策模型各生成一个后继 harness。

结果

RQ1: Claude Opus 4.8 笼统目标 27.07,官方明确任务参考 32.90;GPT-5.6 是 29.58 对 36.23。匹配轨迹里,笼统目标多花 2109 秒决策思考、GPU 空闲多 0.61 小时,有效训练评估少 1.27 小时。任务材料访问密度约 2.98 倍。

RQ2 终局协议 24 跑、12 个模型-目标对,Avg@2 只有科学学术推理上 Qwen3.5-9B 从 45.33 升到 48.00,其余 11 对不高于基线。单跑 24 个终检里 3 个超过基线,21 个回滚。自适应反馈 30 格里 28 格产出检查点、21 格合格,只有 2 格最佳分高于基线,过门且保留下来的仅 Terra 把 4B 数学从 17.86 拉到 20.10。后续后代又掉到 2.78,再回到 18.17。Sol 搜得最凶,33 个检查点、76.56 GPU 小时,没有一格超过基线。

一个具体塌方:五份终检在数字标签 MMLU 上做 SFT,21000 条训练目标全是单位数字,279 条评测输出也全是单位数字,分数为 0、0、0、6.141、0。

RQ3: 原版 Qwen-Agent 任务宏 28.64。Sol 后继 27.22,Terra 20.76,Luna 19.32。4B Creator 没交出合法 harness。Luna 把自建 8 题清单从 7/8 刷到 8/8 后停,隐藏集上变成 19.32。

为什么重要

对想做递归自我改进的人,这篇把「训练环能跑通」和「能力环能闭合」拆开了。Agent 已经会下数据、开 LoRA、交检查点,但面对笼统目标,多数更新是在破坏指令微调已经会的事。看相对上一检查点的斜率会误判,很多上升只是从训练伤里往回爬。

实践含义很硬:没有隐藏评价和使用基线分做回滚,自我训练很容易把格式和能力一起训塌。Harness 编辑同样会过拟合狭窄的自建清单。

局限与存疑

六个目标和 520 题覆盖有限,写作只有 20 条。自适应协议每个配置-目标只有一跑,Terra 的 20.10 是在同一批隐藏题上反复拿总分选出来的,没有独立确认切片,不能当成可复现的能力增益。报告的跑都没把训练后的后代提成下一轮决策模型,所以不是递归替换。

RQ1 的官方参考和笼统目标轨迹在元数据上并不完全对齐,作者自己写成观察差异,不是纯提示因果。内容级轨迹要受控访问才能看,失败模式的归因无法完全公开复核。无关能力有没有被伤到,协议没测。

术语

原文与代码

社区讨论

相关论文

全部论文解读