DeepMind 新论文 Dream-RSI:不改权重,让 Agent 在历史里「做梦」自我改进

AGI Hunt · wechat · 2026-09-16

Google DeepMind 联合马里兰大学等机构发布论文 Dream-RSI,研究递归自我改进(RSI),但路线与传统直觉不同:它不修改模型权重、不自我训练,而是改进 Agent 的探索策略——怎么搜索、开多少分支、何时止损、如何分配算力。

核心机制是把每次任务留下的完整探索历史做成 Replay Simulator,让 Agent 在其中「做梦」,尝试各种反事实假设(换分支、并行更多任务、更早放弃某方向)。由于历史结果已算出,这些实验近乎零成本,形成「探索→积累历史→做梦→改进策略→再探索」的循环。在 GPU Kernel 四个任务上,最好情况下达到同等性能只需基线约 41% 的迭代次数,预算相当时性能最高达基线 2.09 倍。

有趣的对照实验:把过往经验总结塞回 prompt 反而更差,因为总结出的「经验」易变成偏见,让 Agent 过早收敛到少数方向、丧失探索多样性。

所属事件:谷歌开源 Dream-RSI:靠「做梦」复盘实现递归自我改进(14 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →