SGS 论文:7B 模型 200 轮自博弈解压超 671B 模型 pass@4
cephaloform · x · 2026-10-04
斯坦福团队(Luke Bailey、Kaiyue Wen、Kefan Dong、Tatsunori Hashimoto、Tengyu Ma)提出 Self-Guided Self-Play(SGS)论文(arXiv:2604.20209)。
- 问题:LLM 自博弈(Conjecturer 出题、Solver 解题、共同提升)理论上学习无上限,但现有方法在大算力下很快撞上学习平台期。原因:长训练中 Conjecturer 学会 hack 奖励,退化为产出人为复杂、对 Solver 无益的问题。
- 方法:SGS 让模型同时扮演三个角色——Solver、Conjecturer、以及一个 Guide。Guide 按合成题与未解目标题的相关性、干净度和自然度打分,为对抗 Conjecturer 退化提供监督。核心假设:语言模型能判断某个子问题是否对目标有用。
- 结果:在 Lean4 形式化定理证明上,SGS 不到 80 轮自博弈就超过最强 RL 基线的渐近解题率;7B 模型经 200 轮自博弈后,解题数超过 671B 模型 pass@4。
- 通过显著更长的训练并拟合累计解题率 scaling law 来评估可扩展性。
「研究」频道最新
- V-Rubrics:5 万样本拆成 35 万细粒度标准,解多模态 RL 信用分配难题 — jiqizhixin · 2026-10-04
- Looped-DiT:2.6 亿参数循环计算跑赢 6.5 倍大模型,推理算力省 4.9 倍 — Apprehensive_Sky892 · 2026-10-04
- Schmidhuber 称 1987 年就发表首个 RSI 算法,早于当下热潮近四十年 — SchmidhuberAI · 2026-10-04
- Justin Lin 炮轰 HF 日报刷票:有人买 upvote,造假如 GitHub 星标 — teortaxesTex · 2026-10-04
- Hcompany 发布 computer-use 智能体轨迹数据集,登顶 HF 热榜 — Hcompany · 2026-10-04
- 5KB 纯 x86 汇编跑 Gemma-2B:CPU 上 4.6 tok/s — tom_tsai28 · 2026-10-04