DeepMind 发布 Dream-RSI:回放历史发现,搜索成本最高降 162 倍
Dr_Singularity · x · 2026-09-16
Google/DeepMind 研究者提出 Dream-RSI,一个让 AI 智能体改进自身探索策略的递归自我改进系统。
- 核心机制:智能体回放过往的发现尝试,以低成本测试数千种替代探索策略,再把更优的策略部署到下一轮,从而持续改进"如何探索问题"本身。
- 效果:在算法设计、数学优化、GPU kernel 工程三个领域,发现质量持平或更好,同时大幅削减搜索成本——其中一个场景中智能体调用次数最多减少 162 倍。
- 关键区分:它改进的是探索策略(policy),而不是底层模型权重,属于"学如何发现"而非"学知识"。
这一方向被视为通往 AI 辅助自我改进循环的早期示范。
所属事件:谷歌开源 Dream-RSI:靠「做梦」复盘实现递归自我改进(14 条相关)→
「研究」频道最新
- 让 AI 真心做对齐研究后再揭晓:它就是被研究的那一方 — Kitchen-Jicama8715 · 2026-09-17
- Schmidhuber 重提哥德尔机:自指式最优自我改进是 RSI 圣杯 — SchmidhuberAI · 2026-09-17
- Cisco 3B 模型漏洞定位得分 0.223,修复后仍误报远少于 GPT-5.5 — shashib · 2026-09-17
- 自动驾驶世界模型新进展:并行解码蒸馏提升生成效率 — abursuc · 2026-09-17
- NVIDIA SpatialClaw:代码即接口,20 项空间基准超此前 agent 11.2 分 — CMHungSteven · 2026-09-17
- 世界模型互动难题:状态需承载多种频率的信息流 — abursuc · 2026-09-17