港中文提出Libra系统:AgenticRL后训练吞吐最高达基线3倍
机器之心 · wechat · 2026-08-12
针对 Agentic RL 后训练中轨迹长度差异大、GPU 需求随策略动态变化导致系统不稳定的问题,香港中文大学与香港恒生大学团队提出资源管理系统 Libra。
- 核心思路:将训练与 rollout 视为耦合系统统一优化,而非固定瓶颈。通过全局资源规划器联合决策两侧 GPU 分配与并行策略,并周期性根据实时负载动态调整。
- 弹性调度:引入异构推理池与因果感知调度器(C-MLFQ),利用工具返回的因果信号提前预测轨迹长度并精准路由,单次路由准确率达 91.1%。
- 实验效果:在 48 张 A800 GPU 上,覆盖 Search-R1、DAPO-Math 与 R2E-Gym 三类任务。Libra 取得最高吞吐(最高达基线 3.0 倍),达到目标奖励的训练时间最多缩短至基线的 1/2.5。
目前论文与代码已开源。
「Infra」频道最新
- RTX 4080 跑 Minimax Ref2V 频繁爆显存,如何生成长视频? — witcherknight · 2026-08-12
- Nvidia RTX 6000 Pro 官网标价飙升至 1.6 万美元 — Norwood_Reaper_ · 2026-08-12
- 淡马锡拟直接投资三星与 SK海力士,芯片股大涨超 8% — firstadopter · 2026-08-12
- 马斯克畅谈算力愿景:明年达 10GW,AI 推理将走向太空 — elonmusk · 2026-08-12
- AI数据中心高负荷为德州居民带来电费节省 — toptickcrypto · 2026-08-12
- 端侧MoE模型实测:NVIDIA Lightning比Qwen快2.5倍 — parepeg · 2026-08-12