Dream-RSI:让 Agent 在历史轨迹里「做梦」,实验调用最高减少 162 倍
teortaxesTex · x · 2026-09-16
teortaxesTex 引用并评论 Dream-RSI 论文,感慨「递归自我改进(RSI)正变得对自主 AI Agent 越来越重要」这类表述已进入主流——Overton 窗口移动之快,RSI 如今成了和 long context、multimodality 一样的普通研究课题。
论文核心思路:真实实验太贵,就让 Agent 先在自己的历史轨迹里低成本「做梦」。
- 每次真实探索后,系统把走过的分支、失败方案、评测结果和计算成本保存成一棵 Discovery Tree。
- 这些历史被重组成 Replay Simulator,Agent 可在其中低成本试错搜索策略(先探索哪条路、何时并行、何时停止),无需重新执行真实实验。
- 选出更优策略后放回真实环境继续探索,新轨迹再进模拟器,形成自我改进循环。
- 底层 Coding Agent 始终不变,持续进化的是「怎么探索」这层策略。
实验覆盖算法设计、数学优化和 GPU Kernel:Lasso 任务中相比 SimpleTES 最高减少约 162× Agent 调用;GPU Kernel 任务在相同预算下最高获得 2.09× 性能提升。结论是历史轨迹不只能当 Memory,保存足够完整就能变成训练下一代探索策略的模拟环境。
所属事件:Google Dream-RSI 让 Agent 在历史轨迹中「做梦」自我改进(3 条相关)→
「漫话AGI」频道最新
- 训练数据即另一种监管:加上容易,撤销几乎不可能 — yunta_tsai · 2026-09-16
- OpenAI 研究副总裁 Mark Chen:前沿之外不存在 AI 竞赛动态 — deanwball · 2026-09-16
- Gary Marcus 上 BBC:Altman、黄仁勋、Sanders 各执极端,没人说真话 — GaryMarcus · 2026-09-16
- 《人类建造的最后一代 AI》论文提出递归自我改进路线图 — Yi Duan · 2026-09-16
- tszzl:Astra 写的代码已无人能读懂,「可纠正性」全凭信仰 — tszzl · 2026-09-16
- dhh:比起 p(doom),更该讨论 p(abundance),马斯克回应称认同 — markjeffrey · 2026-09-16