SPIRAL/SPICE/SPADE:自博弈让模型无需标注自我进阶推理
青稞AI · wechat · 2026-09-21
青稞AI 介绍大模型 RL 后训练中的自博弈(Self-Play)路线:当模型变强后,人工题目与固定环境跟不上,自博弈可自动生成难度递增的训练信号。斯坦福博士生刘博将于 9 月 23 日直播讲解三篇工作:
- SPIRAL(ICLR 2026):让模型在多轮零和博弈中与变强的自己对弈,无需人工标注即生成无限课程;提出 RAE(role-conditioned advantage estimation)稳定训练。仅用 Kuhn Poker 训练 Qwen3-4B-Base,数学提升 8.6%、通用推理提升 8.4%,超过 25,000 条专家轨迹 SFT。迁移来自系统分解、期望值计算、逐例分析三种认知模式。
- SPICE(Meta FAIR):同一模型分饰 Challenger(从真实语料挖文档出题)与 Reasoner(解题),真实语料提供近乎无穷的外部信号,任务始终停在能力前沿;数学提升 8.9%、通用推理提升 9.8%。
- SPADE:模型同时担任环境设计者(写带 reset/step 接口的可执行环境代码)与求解者;设计者奖励取自求解者有无提示的表现差,使环境难度贴近能力边界。30B 模型在八个评测集平均比最强固定环境基线高 5.3 分,BFCL v4 多轮 +5.7、ACEBench-Agent +13.9。
文章还引出讨论:从对手到题库再到环境,自接管范围越来越大,何时才算真正的「递归自我改进」?
所属事件:斯坦福刘博将直播分享 SPIRAL/SPICE/SPADE 自博弈自我改进研究(2 条相关)→
「研究」频道最新
- CVPR 2026 论文 GaME:让机器人 3D 地图学会遗忘过时几何 — lucacarlone1 · 2026-09-21
- 博客解析 YOCO 与跨层 KV 共享,涉及 DeepSeek-V4.1-Flash 与 Gemma 4 — donglixp · 2026-09-21
- 「死人脑组织控机器人」实验引热议:是创新还是噱头? — ryunuck · 2026-09-21
- 新论文:用均值差向量从模型内部表征提前发现 reward hacking — burny_tech · 2026-09-21
- AI 将如何改变数学家的工作:从软件世界外推的七条预言 — cgarciae88 · 2026-09-21
- Qwen 发布 RecreationBench:250 任务实测 AI 重建真实应用 — burny_tech · 2026-09-21