Google Dream-RSI:让 Agent「做梦」复盘探索史,实现递归自我改进
agihouse_org · x · 2026-09-16
Google 与 Google DeepMind 发布论文 Dream-RSI(Recursive Self-Improvement through Evolving Worlds),提出一条不同于「模型改自己权重」的 RSI 路线:Agent 修改的是自己的探索策略(harness)。
核心机制:
- 每次任务执行都留下完整探索历史:试过哪些方案、哪条分支失败、花了多少计算。
- Dream-RSI 把这些历史做成 Replay Simulator,让 Agent 在其中「做梦」:重放「如果先走另一分支」「多开并行任务」「早点止损」等反事实实验——因为历史结果都已算过,这些实验几乎零执行成本。
- 找到更优策略后部署回真实世界,形成「探索→积累历史→做梦→改进策略→再探索」的闭环。
实验结果:在 GPU Kernel 任务中,VGG16 与 LayerNorm 达到相近性能分别少用 2.43× 和 1.79× 的 generations;ConvDiv 与 ConvMax 在相近预算下性能分别提升 2.09× 和 1.44×。
一个反直觉发现:传统做法——把过往经验总结后塞回 prompt 指导下一轮——反而更差,因为这些「经验」易变成偏见,让 Agent 过早收敛到少数方向,损失探索多样性。论文的启示是:模型未必先学会改权重,可以先学会改自己的 harness。
所属事件:Google 发布 Dream-RSI:让 Agent 在演化世界中「做梦」实现递归自我改进(5 条相关)→
「漫话AGI」频道最新
- Alpha School 拥趸围攻批评者,作者反击「AI 驱动教育」炒作 — benjaminjriley · 2026-09-16
- WaPo 播客对话 Tim Lee:AI 专家最怕什么,末日论是夸张吗 — binarybits · 2026-09-16
- 经济学家:技术变革下最佳路径是让老员工体面退场、新人补位新岗位 — paulnovosad · 2026-09-16
- Zvi 讽刺:宣称「人类可能全灭」已成圈内高地位信号 — TheZvi · 2026-09-16
- Paras Chopra:AI 拉高产出均值却压缩方差,人的价值在于差异化 — paraschopra · 2026-09-16
- 读 AI 就业冲击论文要当心:两种表述同一结果 — paulnovosad · 2026-09-16