Hugging Face 工程师实测:增加 rollout token 预算提升模型胜率
mervenoyann · x · 2026-08-13
Hugging Face 工程师 Merve Noyan 分享了其在 Wordle 游戏上使用 OpenEnv 和 TRL 训练 Nemotron3.5 的实验。
她发现,将每次 rollout 的最大 token 数从 2048 增加到 4096 时,模型的基础胜率从 52% 提升至 68%。她原本希望通过训练让模型更具 token 效率,但模型在 rollouts 期间不断触及长度限制,导致该尝试未能成功,仅增加了侧面奖励。
「研究」频道最新
- AI合成内容泛滥,前AI时代的人类数据会更有价值吗? — ArcanuMELO · 2026-08-13
- 代码审查Agent如何建模不确定性?风险概率的架构设计探讨 — Accomplished-Fun4629 · 2026-08-13
- 具身智能新突破:机器人超尺度运动追踪系统 SONIC 登刊 — zhengyiluo · 2026-08-13
- 研究:LLM 智能边际收益递减,前沿模型溢价面临挑战 — soumitrashukla9 · 2026-08-13
- 研究揭示CLAUDE.md为何无限膨胀:注释可减少99.3%冗余指令 — omarsar0 · 2026-08-13
- 英伟达成立 AI 辅助工程研究组,用神经算子加速物理系统设计 — JeanKossaifi · 2026-08-13