亚马逊研究世界模型论文:2600+ 实验记录训练,跨环境选择遗憾降低 78%
rohanpaul_ai · x · 2026-10-11
arXiv 论文《Language Models as AI Research World Models》:用 LLM 作为研究世界模型(RWM),在有限实验预算下预测候选干预的结果,为递归自我改进铺路。
- 数据规模:超过 2600 条实验记录,覆盖 9 个研究环境(预训练、后训练、推理),相当于 17.1 万 H100 GPU 小时。
- 真实实验经验显著提升对未见过干预的预测(Spearman +0.27),且知识可跨环境复用:仅凭 OLMo3、Marin、Nanochat 的预训练经验,RWM 在 Qwen3 环境中将选择遗憾降低 78%。
- 固定预算多轮自动研究中,环境内与跨环境知识分别提升最佳增益 15.8% 与 11.6%。
- 消融覆盖 13 个 LLM,显示加入研究知识对干预排序的改善甚至超过更换底层模型。
所属事件:亚马逊推出 LLM 研究世界模型,实验前预测试验收益(2 条相关)→
「漫话AGI」频道最新
- Reddit热议:说AI有意识,等于说一段程序能产生意识? — VegetableArea · 2026-10-11
- Nick Bostrom 警告「心智罪」:造出意识机器却不察或酿大规模伤害 — cccalum · 2026-10-11
- 招聘新常态:AI 模型筛选另一 AI 写出的简历 — victor_explore · 2026-10-11
- 英国学者撰文:加速采用 AI 才是对英国最安全的选择 — HaydnBelfield · 2026-10-11
- 中国在建 38 座核反应堆约 39.8GW,能源被视为 AI 最大瓶颈 — kimmonismus · 2026-10-11
- AI 让业余博客式畅想难以为继:会当场被指出文献矛盾 — xuenay · 2026-10-11