AgileRL Arena 1.0 发布:YAML 清单驱动 RL 训练,支持 LoRA/GRPO 微调
Balance- · reddit · 2026-09-11
AgileRL Arena 发布 v1.0,作为 AgileRL 的 SDK/CLI 独立发行版拆分到 PyPI(不依赖 torch),用 YAML manifest 描述算法、环境、网络、变异与选择策略、replay buffer,同一份配置可本地运行或提交到其托管集群。
- LLM 微调路径:接受任意 HF 模型 ID + LoRA 配置,支持 rollout 环境(模型生成、由自定义 reward 打分)或监督数据(objective: sft / preference),示例为 Qwen2.5-0.5B-Instruct
- 进化式 HPO:训练一个 population 并周期性变异架构与超参,保留最优个体,省去手调学习率,代价是同墙钟时间耗更多算力
- 本地训练两行代码即可跑,无需账号;配置经 Pydantic 校验,1.0 拒绝未知键,坏配置在训练前就报错而非 40 分钟后
- 1.0 其他更新:算法经 paradigm builders 构建、本地训练按 paradigm flags 分发、manifest schema 单一来源,新增 arena manifest validate/schema;PEFT 升至 0.20,自动排除 Mamba outproj/conv1d 上的 LoRA
「编程与Agent」频道最新
- GPT 图像分镜 + Seedance 成片,AI 电影工作流开源 — alexcovo_eth · 2026-09-12
- Agent 开发实战:别再单聊,让智能体互相发消息协作才是解锁点 — xeophon · 2026-09-12
- 不动一个按键:手机上用 Astra 生成 3D 模型并完成 Blender 重光照 — bilawalsidhu · 2026-09-12
- 开发者打造可递归自我改进的编程 Agent — zit-hb · 2026-09-12
- 用工具调用检索 Agent 聊天历史,或可突破上下文长度限制 — weswinder · 2026-09-12
- LangChain 团队谈 Engine:用 trace 数据做「开发 agent 的 agent」 — LangChain · 2026-09-12