同一套 GRPO 配方训三个自研 LLM,结果各异且与规模无关

john_enev · reddit · 2026-08-20

作者用原生 PyTorch 从零训练三个 LLM(353M/316M/672M),再各自做 SFT + GRPO(相同课程、奖励函数、超参、KL 系数 0.02),结果 GRPO 表现极不一致:

九个 checkpoint 与在线对比 Playground 均已开源在 Hugging Face。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →