研究者用棋类测试床拆解预训练、SFT 与 RL 算力分配

Pavel_Izmailov · x · 2026-07-21

这项工作提出了一个基于棋类的测试床,用来研究 预训练、SFT 和 RL 之间的算力该如何分配。

所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →