ICML 论文 ThunderAgent:多轮 Agent RL 吞吐量提升近 2 倍
simran_s_arora · x · 2026-07-30
被 ICML 2026 接收为 Spotlight 的论文 ThunderAgent,针对多轮智能体强化学习中的推理效率瓶颈提出了优化方案。该工作目前已整合至 verl-recipe 的 Dynamo 后端。
核心问题与方案
多轮 Agent 推理常因 KV cache 频繁交换导致 GPU 算力浪费。ThunderAgent 在调度器层面引入了程序感知路由机制来缓解此问题。
性能数据
- 在单节点推理中实现 2.5 倍的吞吐量提升
- 高并发场景下将 P50 延迟降低约 10 倍
- 在同步 GRPO 运行中,rollout 吞吐量提升 1.94 倍,全步吞吐量提升 1.39 倍
该系统对提升大规模 Agent 训练与部署的基础设施效率具有显著价值。
所属事件:ThunderAgent系统实现多轮Agent推理近2倍提速(7 条相关)→
「Infra」频道最新
- 英伟达开源 PyCuTe:纯 Python 实现 GPU 核心布局代数 — asdf1234_0 · 2026-07-30
- SGLang 生态昼夜接力,Kimi K3 开源首日推理破 423 tok/s — songhan_mit · 2026-07-30
- UC Berkeley 提出 K-search:将 CUDA 内核优化自动迁移至苹果 MLX — berkeley_ai · 2026-07-30
- 搭载 Nvidia Thor 算力,Advantech 边缘设备跑通 GMSL 摄像头 — chrismatthieu · 2026-07-30
- OpenRouter 数据:Together 提供 Kimi K3 最低价与最高缓存命中率 — zhyncs42 · 2026-07-30
- 三星Q2营业利润飙升1800%创新高,AI芯片需求强劲 — Polymarket · 2026-07-30