Language Models as AI Research World Models
Zijun Wang, Zewen Liu, Minhua Lin, Zhaotian Weng, Zhan Shi, Bing He, Yisi Sang, Dakuo Wang, Benoit Dumoulin, Wei Jin, Yuyin Zhou, Cihang Xie, Hanqing Lu
cs.CL
2026-10-09
亚马逊等机构用九个环境、两千六百余条真实验,让语言模型预测干预收益。同环境排序相关从 0.506 升到 0.774,Qwen3 上选择遗憾降 78%。
研究 agent 提出干预很快,真跑一次很贵。学习率、数据配比、优化器或结构,换一个底座或预算,同一改动可能涨点,也可能没收益甚至变差。预算有限时,先判断哪条值得跑,比再多产点子更影响进度。
世界模型原是用预测动作后果来决策。这里的动作是一条可执行干预,后果是相对参考配方的收益。Research World Model 用同一个语言模型读环境描述和历史实验,估计还没跑的干预能带来多少收益。要回答的是:甲环境的真实验记录,能不能预测乙环境里没见过的干预。
RWM 不更新参数。输入是环境(参考模型、数据、预算、评测协议)、干预(代码 diff 或配置覆盖)和历史记录。输出是收益 gain 的条件中位数。BPB(每字节比特数,越低越好)的 gain 用参考分减候选分,准确率和吞吐用候选减参考,正值表示变好。
历史分三档,骨干和推理档位锁定。无记录称为 W0。同环境只喂本环境已跑记录。跨环境只喂其他环境的记录:目标环境自己的结果不进上下文,与所查干预近重复的一组也从源记录里去掉。记录原文进入提示词,模型返回中位数,不许调用工具或检索。默认骨干是 Claude Opus 5,一百万 token 上下文,推理档位 HIGH。
对照是吃同一批记录的 k 近邻和岭回归。词表、TF-IDF 和超参只在允许的历史上拟合。选实验模拟为每 16 个候选执行 3 个,约两成预算,200 次随机分池取平均。
语料是作者自己跑出的 9 个环境、2653 条记录、171862 个 H100 时。同环境评估 5 个环境。跨环境只在 5 个自回归预训练环境之间做,每次用来源侧 244 条记录。
同环境记录把平均 Spearman(预测与实测的秩相关)从 0.506 提到 0.774。五个环境里,RWM 的 MAE 与 Spearman 都好于 kNN 和岭回归。
| 环境 | 无记录 Spearman | 有记录 Spearman | 无记录 Regret@3 | 有记录 Regret@3 |
| OLMo3-100M | 0.62 | 0.90 | 2.80e-3 BPB | 7.00e-4 |
| 扩散预训练 | 0.46 | 0.78 | 3.14e-3 BPB | 4.70e-4 |
| 数学蒸馏 | 0.43 | 0.70 | 0.48 pp | 0.29 pp |
| Code RL | 0.48 | 0.62 | 2.20 pp | 0.83 pp |
| 推理优化 | 0.54 | 0.88 | 3.60 tok/s | 2.53 tok/s |
Regret@3(从 16 个候选里选 3 个时,错过池中最优所损失的收益)的等权平均相对降幅是 58.2%。NDCG@3(只计正收益的排序质量)从 0.599 升到 0.785。排序上 RWM 五个环境都胜过两个回归基线。推理优化这一格,kNN 的 Regret@3 为 1.62 tok/s,有记录 RWM 为 2.53,kNN 更低。
跨环境宏观 Spearman 从 0.628 到 0.729,宏观 Regret@3 相对无记录降 52.2%。Qwen3 从 9.40e-4 降到 2.10e-4 BPB,相对降 78%,来源只有 OLMo3、Marin、Nanochat。kNN 换到这些目标后五个全部低于 W0,宏观 Spearman 0.36。Nanochat 已经在用 Muon。源记录里相近改动大多有益,kNN 预测 +0.018 BPB,实测为 −0.036,W0 预测 −0.035。配方不同时,语义近邻会指错方向。
OLMo3-100M 的多轮协议重复 5 次、每次 8 轮,每轮 16 个新候选里选 3 个,共 24 次执行。相对无初始记录,同环境记录把最终最好收益提高 15.8%,跨环境提高 11.6%。nAULC 以事先知道实测增益的 Arrival Oracle 为 100%,无记录、同环境、跨环境分别为 85.26、98.26、94.34。同一批跨环境记录交给 kNN 和岭回归,得到 86.16 和 78.06。
13 个骨干(含 Claude Opus 5、Grok-4.6、GPT-5.6 系列、Kimi-K2.5、DeepSeek-V3.2)在无记录时 Spearman 落在 −0.362 到 0.621,有记录后落在 0.638 到 0.896,两段不重叠。Claude Opus 5 把推理档位从 LOW 提到 MAX,Spearman 只从 0.609 到 0.648。档位停在 LOW、加上记录,则到 0.892。
给 16 个候选各预测一次,Claude Opus 5 约 6.3 美元。九个环境单次实验算力成本的中位数是 42.3 个 H100 时,按每时 3 美元约 127 美元。一轮打分大约是一次代表性实验的 5%。
研究 agent 更缺的是执行名额。已经付过钱的日志里,失败记录同样要留,它们可以变成下一次选择的证据。
补上实验记录带来的排序提升,大于换骨干,也大于把推理档位拉满。收益来自上下文学习,专用世界模型还没训出来,幅度是渐进的。手头有大量内部实验日志的团队,优先把日志接进选实验。
跨环境只做了自回归预训练。扩散、数学蒸馏、Code RL、推理优化只报告了同环境。环境内的实验都从同一套参考配方出发,中途换底座不在测试范围内。
五个目标的跨环境 Spearman 点估计都高于 W0,配对 bootstrap 有两格跨过零。OLMo3-190M 相对 W0 为 +0.06,区间 [−0.07, +0.18]。Marin 为 +0.08,区间 [−0.05, +0.24]。Marin 的选择同样走弱:Regret@3 从 7.40e-4 到 7.90e-4,NDCG@3 从 0.74 到 0.70。
Code RL 的历史只有 34 条,测试有 115 条,这一格最薄。自回归预训练里,参考配置重复跑的 mean BPB 标准差约 0.003 到 0.006,单条干预的重复方差没有测量。OLMo3-100M 的同环境 MAE 从 2.93e-2 降到 2.03e-2 BPB,仍是参考波动的数倍。站得住的是排序和选择,收益数值本身还飘。
预测走商业 API,做不到比特级复现。多轮协议是封闭候选集:231 条事先采好,按机制复杂度分八轮放入,方法只负责挑。预测变准之后,研究是否更有效,还要看数据采集、推理和执行的总账。换到没有相近记录的环境类型,以及用这些记录训练专用 RWM 能否超过上下文学习,这两项都尚未有结果。