Tetris RL 实验一周卡关:pretraining 决定 RL 上限,shape rewards 始终更优
shizhediao · x · 2026-10-10
作者在 Tetris 上尝试从 shaped rewards 切换到 terminal rewards(如整局消行数),用尽 backplay、prefix/continuation、credit assignment、控制随机性等手段,成绩始终卡在 150 行以下,而同规模模型用 shaped rewards 可达 550 行。最终起作用的竟是「更多 pretraining」。
- 关键发现:pretraining 基本决定了模型 RL 后的起点和收敛上限,不只是「达到某水平需要多少算力」,而是会永久卡在更低水平。
- 作者请 ChatGPT 给出了 Lean 认证的证明:存在精确 PPO 收敛到劣策略的反例,完美 critic 和更多迭代都救不了。
- 两个解法:更好的 pretraining,或 process rewards。
- 作者暗示对 LLM 而言,「更多 RL 迭代」的惊艳结果可能另有隐情。
「研究」频道最新
- COLM 最佳论文:Int-Bench 揭示 LLM 助手过早、过频干预有碍学习 — maxhkw · 2026-10-10
- Demis Hassabis:AI 最重要应用是改进医学与人类健康 — DeryaTR_ · 2026-10-10
- Group-Evolving Agents 获 COLM 2026 奖:SWE-bench 71% 超越人类设计框架 — xwang_lk · 2026-10-10
- 25 个脑区闭环实验:主流大模型脑活动对齐差异被隐藏 — ShahabBakht · 2026-10-10
- 学者自建 ICLR 2027 录用预测市场,用虚拟货币押注论文命运 — prof_kamilov · 2026-10-10
- 用进化式 LLM 程序搜索刷新 25 项正方形堆叠纪录 — tak3sh8 · 2026-10-10