Dream-RSI:让智能体靠「做梦」回放历史实现策略自改进

inductionheads · x · 2026-09-16

Steve Hsu 转发的一项研究提出 Dream-RSI:一个递归自改进循环,智能体在线探索并持续收集发现历史,再用这些历史构建回放模拟器(replay simulator),通过「做梦」式探索替代策略来优化元探索策略,最后把改进后的策略重新部署到线上。作者将其类比为人类通过内省认识大脑并自我改进的机制。实验显示 Dream-RSI 在多个场景下同时提升了发现的有效性与效率。

所属事件:谷歌开源 Dream-RSI:靠「做梦」复盘实现递归自我改进(14 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →