斯坦福刘博直播分享 SPIRAL/SPICE/SPADE:模型自设计环境实现递归自我改进
_AndrewZhao · x · 2026-09-21
青稞社区第156期直播预告:北京时间9月23日上午10:00,斯坦福大学博士生刘博分享 SPIRAL、SPICE、SPADE 三篇成果,探讨自我改进何时称得上递归自我改进、以及自博弈与递归自我改进的关系。
核心工作是 SPADE:持续自我改进需要不断扩大的训练环境供给,SPADE 让同一个模型同时扮演「环境设计者」和「推理智能体」,自动编写可执行、随能力提升而变难的 agentic 训练环境,实现环境规模化的自我驱动。
「研究」频道最新
- 研究揭示 RL 训练不稳定根源:Score Centering 实为 STE 技巧 — brandondamos · 2026-09-21
- 研究者仍把 Transformer 当黑盒:公开讨论十年内难有真理解 — gerardsans · 2026-09-21
- 论文找到 On-Policy 蒸馏失效元凶:EOS token 不匹配 — tw_killian · 2026-09-21
- 研究:GPT-5 与 Gemini 2.5 的俳句已难与人类作品区分 — s_scardapane · 2026-09-21
- 让 Agent 操作 AI 生成的排版工具界面,完美破解 LLM 字符级任务短板 — Future_Candidate2732 · 2026-09-21
- 研究员推荐:借动物认知原理评估 LLM 的传递推理能力 — tomssilver · 2026-09-21