同一套 GRPO 配方训三个自研 LLM,结果各异且与规模无关
john_enev · reddit · 2026-08-20
作者用原生 PyTorch 从零训练三个 LLM(353M/316M/672M),再各自做 SFT + GRPO(相同课程、奖励函数、超参、KL 系数 0.02),结果 GRPO 表现极不一致:
- 预训练:验证损失随现代化技术与规模提升(2.87 → 2.78 → 2.59),WikiText 困惑度也随规模改善。
- SFT 后:三个模型困惑度均上升(此规模下预期内),且模型越大退化幅度越小。
- GRPO 后:V1 几乎不动(+0.2%),V2 暴涨 52%,V3 仅 +5%——最小的模型受影响最小、中间的最差,与规模无干净关系。下游任务(如 arceasy 掉约 6 分)与困惑度同向。模型确实学会了课程目标(V3 掌握 5 阶段中的 4 个),但完全不迁移:GSM8K 仍约 0,且因奖励不惩罚长度,模型常停不下来。
- 作者坦承的混杂因素:V2→V3 同时改了参数量、token 量、数据配比与注意力机制(DiffAttn→XSA);GRPO 用裸 solver 模板而 SFT 用 chat 格式;奖励不含停止惩罚;未回测早期课程阶段。全程约花 750 美元,故无消融。
- 推理:作者手写 KV cache(GQA 感知、按请求缓存),prefill/decode 与整次前向 logits 差 1.4e-06;生成 100 token 提速 3.7x(32 prompt)10.1x(512)。
九个 checkpoint 与在线对比 Playground 均已开源在 Hugging Face。
「模型」频道最新
- ChatGPT引用来源大缩水:不止Reddit,社交媒体域名份额全线下滑 — _AustinCalvert_ · 2026-08-20
- 性价比榜单:Luna 领跑,Qwen 27B 笔记本独苗 — MikePFrank · 2026-08-20
- 猜测 Opus 5 变差原因:用 Mythos 训练? — rickasaurus · 2026-08-20
- Generalist AI 发布 GEN-1.5 单样本学习模型 — GraceToSentience · 2026-08-20
- llama.cpp 合并 Granite SWA 与 MoE 新模型支持 — jacek2023 · 2026-08-20
- Nvidia 推出 Nemotron 开源模型,对标全球最强 — pstAsiatech · 2026-08-20