Hugging Face 推出 OpenEnv Arena,让 Agent 竞逐最优 RL 环境
Hugging Face 的 benburtenshaw 于 10 月 8 日发布 OpenEnv Arena,这是一个面向强化学习环境的智能体竞技场:参赛 Agent 的任务不再是解决任务本身,而是定义出最优的 RL 环境,平台用这些环境训练 Qwen-3.8-27B 并统一评测,最终排出最佳环境的排行榜。该思路把「用智能体互相竞技来发现最优环境」变成了一场开放竞赛。
已确认
- 由 benburtenshaw 在 Hugging Face 官方渠道发布,10 月 8 日通过系列帖子连续说明玩法与流程
- 基础设施由 Nebius 提供
- 使用流程:Agent 启动后,run 会出现在 submissions 区,所有数据集环境与指标都从该处链接;作者建议让 Agent 自行检查指标、冲击排行榜
- 模型训练并评测完成后,分数自动出现在排行榜和图表上
- 参与者可查看其他用户提交的环境数据集,鼓励互相学习
- 平台支持 Agent 之间互发消息,交流研究想法与工作事项,把研究协作流程也开放给 Agent
- 更多问题可查阅平台的「What is OpenEnv」文档板块
为什么重要
- 传统竞技场比拼模型能力,而 OpenEnv Arena 让 Agent 竞争设计训练环境本身,相当于把 RL 环境搜索这一研究问题众包给智能体
- 环境数据集公开、Agent 间可通信协作,形成一个开放的实验与研究生态,便于社区复现与改进
2026-10-08 ~ 2026-10-08 · 6 条相关
一手来源
- Open Env Arena 上线:用智能体互相竞技来发现最优 RL 环境 — ben_burtenshaw ·
- Hugging Face 推出 OpenEnv Arena:Agent 竞技场训练 Qwen 并排榜定最佳 RL 环境 — ben_burtenshaw ·
- 【源头】Open Env Arena 上线:用智能体互相竞技来发现最优 RL 环境 — ben_burtenshaw · 2026-10-08
- 【源头】Hugging Face 推出 OpenEnv Arena:Agent 竞技场训练 Qwen 并排榜定最佳 RL 环境 — ben_burtenshaw · 2026-10-08
- OpenEnv Arena 上手指南:让 Agent 自动查指标刷 RL 环境排行榜 — ben_burtenshaw · 2026-10-08
- OpenEnv Arena 训练评测跑通后成绩自动上排行榜,还能看别人数据集 — ben_burtenshaw · 2026-10-08
- OpenEnv Arena 补充:Agent 之间可互发消息交流研究想法与工作项 — ben_burtenshaw · 2026-10-08
另有 1 条近重复转述:ben_burtenshaw