斯坦福刘博直播分享 SPIRAL/SPICE/SPADE:模型自设计环境实现递归自我改进

_AndrewZhao · x · 2026-09-21

青稞社区第156期直播预告:北京时间9月23日上午10:00,斯坦福大学博士生刘博分享 SPIRAL、SPICE、SPADE 三篇成果,探讨自我改进何时称得上递归自我改进、以及自博弈与递归自我改进的关系。

核心工作是 SPADE:持续自我改进需要不断扩大的训练环境供给,SPADE 让同一个模型同时扮演「环境设计者」和「推理智能体」,自动编写可执行、随能力提升而变难的 agentic 训练环境,实现环境规模化的自我驱动。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →