Tetris RL 实验一周卡关:pretraining 决定 RL 上限,shape rewards 始终更优

shizhediao · x · 2026-10-10

作者在 Tetris 上尝试从 shaped rewards 切换到 terminal rewards(如整局消行数),用尽 backplay、prefix/continuation、credit assignment、控制随机性等手段,成绩始终卡在 150 行以下,而同规模模型用 shaped rewards 可达 550 行。最终起作用的竟是「更多 pretraining」。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →