Google 等提出 Dream-RSI:用历史发现构建回放模拟器实现递归自我改进
burny_tech · x · 2026-09-19
Google、DeepMind、UMD 等机构发布论文 Dream-RSI,提出一种可扩展的递归自我改进(recursive self-improvement)探索框架。
- 核心问题:现有 agent 的探索策略是固定的,搜索空间变大后无法适应;在线策略优化又依赖昂贵、延迟的长程反馈。
- 关键洞察:agent 积累的发现历史可以充当「回放模拟器」——在由历史发现树构建的模拟器中「做梦」(dreaming),以低成本离线策略反馈来评估和改进探索策略,无需反复进行昂贵的真实评估。
- 自我改进闭环:改进后的策略重新部署到线上驱动新发现,新发现又扩大模拟器池,形成递归改进循环;轻量编排层使探索显式可编程,底层编码 agent 本身不变。
- 结果:在算法工程、数学优化、GPU kernel 工程三个领域,实现同等或更好的发现质量,同时大幅降低发现成本。
所属事件:谷歌Dream-RSI:AI在「梦境」中递归自我改进(13 条相关)→
「编程与Agent」频道最新
- GPT 把经典射击游戏 Soldat 原版移植到了网页端 — mayfer · 2026-09-19
- OpenClaw 推出多人协作模式,解决 AI Agent「人类代理」痛点 — heyneighbor · 2026-09-19
- Computer-use agents 不等于 GUI agents:点击只是用电脑的一种方式 — DhruvBatra_ · 2026-09-19
- Muse 智能体真实代订机票,全程无差错完成 — alexandr_wang · 2026-09-19
- browser use 成大宗货:无护城河,头部网站自建 agent 工具将取代 — tedddyoweh · 2026-09-19
- 用 TypeSafe Jev 做 Flue 智能体的类型化路由器 — irvinebroque · 2026-09-19