Hugging Face 上跑大规模 Agent RL 训练:14 小时开 9523 个沙箱

vanstriendaniel · x · 2026-09-16

有团队首次在 Hugging Face Hub 上以沙箱隔离方式大规模运行多轮 Agent 的 RL 训练:14 小时内生成了 9,523 个沙箱环境,对 Qwen3-Coder-30B-A3B(30B MoE)做全参数训练,采用 FSDP2 + expert parallel,全程跑在 HF Jobs 上,无需 Slurm,零崩溃。展示了用托管算力替代传统集群跑 Agent RL 的可行路径。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →