谷歌Dream-RSI:让AI在历史搜索树里做梦,调用量最高省162倍
量子位 · wechat · 2026-09-17
谷歌团队发布 Dream-RSI 论文:不重训模型、不修改权重,而是把 Agent 真实探索留下的历史记录当作「模拟世界」,在其上虚拟推演新的探索策略,即「做梦」。
- 三步循环:真实探索产生发现树 → 另一个 LLM 在旧发现树上回放、评估新探索策略(综合答案质量、搜索成本、并行效率)→ 把更优策略派回真实环境,产生更大的新发现树,循环迭代。
- 效果:在算法工程、数学优化、GPU Kernel 优化共 8 个任务上验证。优化 Lasso 正则化路径时,固定策略需 550 次 Agent 调用,Dream-RSI 仅 317 次且运行时间更短;与 SimpleTES 相比最高相差 162 倍调用量。数学优化 SumDifference 上调用量 1000 vs 51200。
- 反直觉发现:把踩坑总结成「经验教训」塞进下一轮 prompt,效果反而普遍下降——过早的先验会堵死看似无望实则有效的路线。
- 定位:模型不变,进化的是 Harness——探索方法本身在自我改进。论文由 Google、DeepMind、马里兰大学与弗吉尼亚大学合作完成,代码与项目页已公开。
所属事件:DeepMind 发布 Dream RSI,让智能体在历史探索中自我改进(2 条相关)→
「编程与Agent」频道最新
- 开发者一晚造出本地 EPUB 转有声书工具,全程 Mac 端侧运行 — ojasvi_yadav · 2026-09-17
- NewMax 浏览器插件升级:适配 Browser Use 支持本地模型 — yangyi · 2026-09-17
- Google 推 Agentic 视频理解,三家公司落地长视频处理案例 — MarioLucic_ · 2026-09-17
- 模拟真实用户行为的 Agent 转岗监控生产环境 — KlausCodes · 2026-09-17
- 两周上线:GLM 智能体自建推理基建,端到端吞吐提升 3.2 倍 — jietang · 2026-09-17
- 从零构建编码 Agent 完整指南:工具设计到提示词,成本不到 1 美元 — Al_Grigor · 2026-09-17