DeepMind 新论文 Dream-RSI:不改权重,让 Agent 在历史里「做梦」自我改进
AGI Hunt · wechat · 2026-09-16
Google DeepMind 联合马里兰大学等机构发布论文 Dream-RSI,研究递归自我改进(RSI),但路线与传统直觉不同:它不修改模型权重、不自我训练,而是改进 Agent 的探索策略——怎么搜索、开多少分支、何时止损、如何分配算力。
核心机制是把每次任务留下的完整探索历史做成 Replay Simulator,让 Agent 在其中「做梦」,尝试各种反事实假设(换分支、并行更多任务、更早放弃某方向)。由于历史结果已算出,这些实验近乎零成本,形成「探索→积累历史→做梦→改进策略→再探索」的循环。在 GPU Kernel 四个任务上,最好情况下达到同等性能只需基线约 41% 的迭代次数,预算相当时性能最高达基线 2.09 倍。
有趣的对照实验:把过往经验总结塞回 prompt 反而更差,因为总结出的「经验」易变成偏见,让 Agent 过早收敛到少数方向、丧失探索多样性。
所属事件:谷歌开源 Dream-RSI:靠「做梦」复盘实现递归自我改进(14 条相关)→
「编程与Agent」频道最新
- 用 Jev 搭实时爆款分析器:结构化输出让分析每 0.5 秒刷新 — jasonkneen · 2026-09-17
- Agent token 为何爆炸?系统提示、工具输出与循环上下文是大头 — Mks-101 · 2026-09-17
- OpenEnv 将支持多 harness RL 训练:任选模型、沙盒与编码 Agent — SergioPaniego · 2026-09-17
- MCP 服务器对匿名 tools/list 返回 401,目录全部显示 0 能力 — dsternlicht · 2026-09-17
- 一个 Prompt 拆成 100 个并行 Agent,详解 Google Agent Graphs 思路 — goyalshaliniuk · 2026-09-17
- 开发者热议 jev 原语:AI 应组合进系统而非取代系统 — teropa · 2026-09-17