小规模强化学习玩家:每晚几百条 rollout 也能感知模型变强

网友 @cephaloform 分享了自己的小规模强化学习训练体感:每晚只跑 400-600 条 rollout 的 RL,但每次新 checkpoint 部署后都能明显「感觉到」模型的进步。他随后跟帖感叹,照此效果「也许不需要 3.8 35b」这样的大模型,暗示小模型配合小规模强化学习已能带来可观的能力提升。这一经验引发社区对 RL 训练规模门槛的讨论。

2026-09-04 ~ 2026-09-04 · 2 条相关