you.com 搜索进 RL 循环训练 Nemotron,BrowseComp 升至 45.45%

PolarBearby · x · 2026-10-07

you.com 与 NVIDIA、CoreWeave 合作,把 you.com 的网络搜索能力放进开放权重模型 Nemotron 3.5 Lightning 的强化学习训练循环中,用于后训练其网络搜索能力。

关键结果:

技术背景:CoreWeave 的 RL Rollouts 让新权重可以热加载到在线部署中而无需重新部署(比传统 redeploy 快约 15 倍),使「推理嵌入训练循环」的 RL 后训练流程大幅提速。这展示了用外部搜索工具在 RL 中训练开放权重模型的完整基础设施路径。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →