Dream-RSI 论文:不改权重靠优化搜索策略,算力效率提升最高 162 倍
r0ck3t23 · x · 2026-09-19
Google、Google DeepMind、马里兰大学与弗吉尼亚大学的研究者发布 Dream-RSI,展示了一种不提升模型本身、也能让 AI 系统变强的路径。
核心思路:
- 模型和评估器权重完全固定,改进的对象是搜索策略本身——去哪搜、并行开多少分支、何时止损、何时加大投入。
- Agent 做探索时会留下一棵记录完整的搜索树(成功分支、死路、得分、成本)。Dream-RSI 把这些历史数据变成「训练场」,在其中低成本回放并测试大量不同的探索策略,无需重跑昂贵的底层实验。
- 最优策略再投入真实任务生成新的搜索树,循环迭代。作者称这是 AlphaEvolve 类「改进被搜索的解」路线的反面:改进的是搜索器。
报告的收益相当大:
- Lasso 路径求解任务:比 SimpleTES 少用最多 162 倍的 agent 调用,比更强的固定探索基线少约 1.7 倍。
- 数学优化任务:预算效率超 SimpleTES 50 倍以上。
- GPU kernel 优化:同等性能下生成次数减少约 1.8–2.4 倍,或同预算下产出更快的 kernel。
作者的判断是:大家习惯把能力提升等同于权重变好,但「如何高效搜索模型已有能力」是常被忽视的另一层——改进搜索后,同样的权重也能变得有用得多。
所属事件:谷歌 Dream-RSI:AI 在历史「梦境」中递归自我改进(15 条相关)→
「研究」频道最新
- Jasper 发布 RL 训练搜索 Agent 教程:奖励函数微调全程开源 — simonguozirui · 2026-09-19
- Reddit 讨论:人们常说「不理解 LLM 如何运作」到底指什么 — RedParaglider · 2026-09-19
- Reddit 对齐脑洞:让模型永远怀疑自己正被评测 — Chemical-Year-6146 · 2026-09-19
- 新研究:侮辱与悲伤对模型情绪向量的作用方向截然相反 — repligate · 2026-09-19
- 伯克利开设 AI 与增长博士读书会,聚焦自动化对高薪认知工作的冲击 — TaniaBabina · 2026-09-19
- Anima Labs研究:Claude各代"模拟器先验"中痛苦表达自Opus 4.8起增多 — repligate · 2026-09-19