每晚只用 400-600 次 rollout 做 RL,作者称能「感觉到」模型变强

cephaloform · x · 2026-09-04

网友 @cephaloform 分享自己小规模强化学习的体感:每晚只跑 400-600 条 rollout 的 RL,但每次新 checkpoint 部署后都能「感觉到」模型的进步。后续他补充:这样看来「也许我不需要 3.8 35b」——暗示小模型+少量 RL 微调已够用。小成本 RL 训练的真实体感分享,对个人微调玩家有参考性。

所属事件:小规模强化学习玩家:每晚几百条 rollout 也能感知模型变强(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →