斯坦福刘博将直播分享 SPIRAL/SPICE/SPADE 自博弈自我改进研究

青稞社区第 156 期直播将于北京时间 9 月 23 日上午 10:00 举行,斯坦福大学博士生刘博将分享 SPIRAL、SPICE、SPADE 三篇成果。该系列工作探讨大模型 RL 后训练中的自博弈(Self-Play)路线:当模型变强后人工题目与固定环境跟不上,自博弈可自动生成难度递增的训练信号,实现无需标注的递归自我改进与自博弈进化推理。

2026-09-21 ~ 2026-09-21 · 2 条相关