Hugging Face 工程师实测:增加 rollout token 预算提升模型胜率

mervenoyann · x · 2026-08-13

Hugging Face 工程师 Merve Noyan 分享了其在 Wordle 游戏上使用 OpenEnv 和 TRL 训练 Nemotron3.5 的实验。

她发现,将每次 rollout 的最大 token 数从 2048 增加到 4096 时,模型的基础胜率从 52% 提升至 68%。她原本希望通过训练让模型更具 token 效率,但模型在 rollouts 期间不断触及长度限制,导致该尝试未能成功,仅增加了侧面奖励。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →