16万次训练大规模实证:离线策略学习无万能算法,调参可颠覆排名
raivn · hf · 2026-10-08
Hugging Face 发布大规模离线强化学习与模仿学习实证研究,训练超 160,000 个策略,覆盖 114 个数据集。
关键发现:
- 没有任何算法全面占优:最强方法的总体性能接近,但不同环境下领先者差异显著
- 超参数调优经常重塑算法的感知排名
- Benchmark 构成可能产生相互矛盾的结论
- 研究了超参数敏感性与跨环境迁移,提出了一种简单策略来推导强默认配置
- 开发了数据集条件推荐器,为从业者提供任务特定的算法推荐
同时发布 JumpStart 资源套件:包含所有已训练策略、逐模型分数与超参数、各环境强基线、训练与评估代码,以及可扩展的结果检索/分析网站。
「研究」频道最新
- CoLM 2026 海报:vibe 测试能否替代不可信的基准? — boknilev · 2026-10-08
- Baseten 研究团队 3 篇论文全部入选 NeurIPS 工作坊 — baseten · 2026-10-08
- 2700万体素三维搜索:开放词汇嵌入融合谷歌3D Tiles — bilawalsidhu · 2026-10-08
- SEAR 研究成果亮相 COLM 2026,论文与代码即将发布 — WenhuChen · 2026-10-08
- LeJEPA 让你能在自有数据上预训练自监督视觉模型,不再等下一个 DINO — randall_balestr · 2026-10-08
- LEDGER:从第一视角视频构建持久 3D 物体记忆,不看回放答题 — mangahomanga · 2026-10-08