AgileRL Arena 1.0 发布:YAML 清单驱动 RL 训练,支持 LoRA/GRPO 微调

Balance- · reddit · 2026-09-11

AgileRL Arena 发布 v1.0,作为 AgileRL 的 SDK/CLI 独立发行版拆分到 PyPI(不依赖 torch),用 YAML manifest 描述算法、环境、网络、变异与选择策略、replay buffer,同一份配置可本地运行或提交到其托管集群。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →