谷歌 Dream-RSI 让智能体「做梦」自进化:317 次调用碾压 5 万代搜索
新智元 · wechat · 2026-09-17
谷歌联合 Google DeepMind、马里兰大学等发布 Dream-RSI 论文,展示不改动底层权重的递归自我改进路线:把智能体的探索历史存成「发现树」,策略迭代时直接在树上重放历史(不调模型、不跑代码),如同棋手复盘棋谱。
核心机制:
- 两层架构:底层「发现智能体」(Gemini 3.1 Pro / 3.7 Flash)负责改代码并接受评估;顶层是一段可进化的 Python 探索策略,决定分支选择、并行数量与止损时机
- 三阶段闭环:真实探索记录发现树 → 构建重放模拟器池 → 策略开发智能体在模拟器中生成上千候选策略并打分择优,新策略得分不低于旧策略,飞轮单调不退化
实测结果:
- Lasso 求解器优化:317 次调用即超过需 51200 次生成的基线 SimpleTES 水平
- 圆填充等数学优化问题:1000 代内追平或超越强基线,节省超 50 倍计算预算,追平 AlphaEvolve V2 纪录
- GPU 内核优化:同等性能生成次数降至 1/2.43,同等预算性能提升 2.09 倍
反直觉发现:把历史总结成高层「经验提示」注入 prompt,反而显著劣于无指导基线——抽象原则会变成认知偏见、压缩探索空间;而 Dream-RSI 直接在具体历史树上做代码级优化,保持探索多样性。一作 Tong Zheng 为马里兰大学博士生、谷歌暑期研究员。
所属事件:谷歌开源 Dream-RSI:靠「做梦」复盘实现递归自我改进(14 条相关)→
「编程与Agent」频道最新
- 用 Jev 搭实时爆款分析器:结构化输出让分析每 0.5 秒刷新 — jasonkneen · 2026-09-17
- Agent token 为何爆炸?系统提示、工具输出与循环上下文是大头 — Mks-101 · 2026-09-17
- OpenEnv 将支持多 harness RL 训练:任选模型、沙盒与编码 Agent — SergioPaniego · 2026-09-17
- MCP 服务器对匿名 tools/list 返回 401,目录全部显示 0 能力 — dsternlicht · 2026-09-17
- 一个 Prompt 拆成 100 个并行 Agent,详解 Google Agent Graphs 思路 — goyalshaliniuk · 2026-09-17
- 开发者热议 jev 原语:AI 应组合进系统而非取代系统 — teropa · 2026-09-17