Scaling Automatic Research Agents via World Models
Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao
cs.LG
2026-08-13
Illinois 与 Amazon 用世界模型代替沙箱执行做科研 agent 的 GRPO,再用 10% 真执行校正偏差和噪声。4B/9B 训练算力降到约三分之一,9B 在 MLE-Dojo 与 DSBench 上超过 120B 开源 agent。
自动科研 agent 的 RL 轨迹有两截:模型生成可以批处理,环境执行必须独占沙箱和真机时间。轨迹一加,执行先把算力顶满。Illinois 与 Amazon 把执行换成世界模型的几次前向,让奖励侧也能批起来。
世界模型与 agent 同骨架,冻结,只吃题面和代码、吐预测分数。标准 GRPO 对每个题采 n≥2 条轨迹,组内减均值得到优势。世界模型接口与真环境相同,更新公式不用改,变的只是分数从哪来。同骨架是刻意的:增益不能解释成偷偷蒸馏了更强模型。全程只更新 agent。纯替换会把偏差 b 和噪声 ξ 写进策略梯度,收敛界多出 O(B²) 和 O(σ²),偏差项靠训练步数消不掉。
WMRL 每步留约 10% 的组做锚点,同时跑真执行。在线去偏用保序回归,把世界模型分数映射回真分,并随新锚点重拟合。逆方差去噪按两路梯度的方差加权融合:世界模型更吵时,锚点权重大;残差很大、结果从代码读不出来时,更新会退回普通 GRPO。理论证明两项修正都严格收紧收敛界,偏差地板随步数收缩。
MLE-Dojo 测试集和完全留出的 DSBench,指标是真实竞赛榜百分位,avg@8。
| 方法 | GPU 小时 | MLE 均分 | DSBench 均分 |
| Qwen3.5-4B GRPO | 883 | 15.2 | 25.7 |
| 4B 纯世界模型 | 269 | 12.9 | 23.1 |
| 4B WMRL | 286 | 16.4 | 28.8 |
| Qwen3.5-9B GRPO | 1174 | 18.8 | 31.2 |
| 9B WMRL | 349 | 21.6 | 32.8 |
| Kimi-48B-A3B | — | 8.1 | 17.3 |
| Nemotron-120B-A12B | — | 20.5 | 31.7 |
相对同规模真执行 GRPO,算力约 3.1 倍和 3.4 倍,分数还略高。4B 超过 48B,9B 超过 120B,幅度不大但方向稳定。纯世界模型两档都低于真执行 GRPO,校正不是装饰。消融里去偏单独贡献更大,两路一起用才到全部分数。
消融里 4B 两路都不开时 MLE 13.5 / DS 25.3;只去噪 14.9 / 26.2;只去偏 15.7 / 28.1;两个都开 16.4 / 28.8。9B 对应 16.8/29.5、18.0/31.2、19.4/31.7、21.6/32.8。同一套做法迁到 MiniVLA-1B 的 LIBERO-Long:SFT 总体成功率 37.4,真执行 GRPO 38.3,WMRL 41.2。VLA 侧用现成 VLM Robometer 对每条 rollout 抽 8 帧预测进度当稠密奖励,环境末尾的稀疏成功当锚点。单靠稀疏成功或单靠世界模型都几乎不动。
agent RL 的贵处往往在环境,不在 token。执行结果能从产物里猜、又能抽一小股真值来校准,就可以把世界模型当可批处理的奖励机。科研 agent 和机器人后训练都符合这个形状。4B/9B 能打过更大规模的开源 agent,说明这条后训练比裸扩参数更划算。
世界模型冻结且与 agent 同骨架,换域要重做。仍要 10% 真执行,不是零环境。图像赛道仍然很弱(4B 5.2,9B 7.4)。4B 文本类相对 GRPO 低 0.5,9B 回归任务低 1.2。训练/测试是作者按类别手划的,因为官方 MLE-Bench 测试集有问题。理论依赖光滑和梯度支配。榜百分位是 avg@8,方差不会写在主表里。