Together AI 推出 ThunderAgent,实现智能体推理 2 倍加速
Together AI 推出了面向大规模智能体推理的高吞吐量系统 ThunderAgent,该成果已被 ICML 2026 接收为 Spotlight 论文。该系统通过引入全新的程序级调度抽象,有效解决了智能体工作流中的性能瓶颈,并实现了多节点的近线性扩展。
已确认
- 要点 ThunderAgent 引入了程序级抽象来调度智能体的 LLM 请求。传统请求级引擎无法感知同一工作流中多次调用的关联性,在等待工具调用时会导致 GPU 空闲,传统 LRU 策略会盲目清除即将复用的缓存,引发严重的 KV cache 抖动与级联重算。新系统在调度器层面解决了该问题。
- 要点 在性能表现上,ThunderAgent 实现了单节点吞吐量 2 倍提升。
- 要点 该多节点推理引擎支持近线性扩展,且为即插即用,只需一个 program 即可运行。扩展测试显示,从 16 GPU 扩展至 64 GPU 时,步骤/分钟从 671 提升至 2248。领先幅度随集群规模扩大而增加,2 节点(32 GPU)速度为单节点的 1.79 倍,8 节点(64 GPU)为 2.39 倍。
为什么重要
- 要点 复杂智能体工作流通常包含多轮工具调用,传统推理引擎在处理此类并发任务时存在严重的效率瓶颈。ThunderAgent 从底层调度机制入手消除缓存抖动,能够以较低的接入成本显著提升大规模集群的推理吞吐量。
2026-07-30 ~ 2026-07-30 · 6 条相关
一手来源
- ICML 2026 论文 ThunderAgent:解决智能体推理 KV 缓存抖动 — togethercompute ·
- Together Compute 发布多节点推理引擎,支持近线性扩展 — togethercompute ·
- ICML 2026 Spotlight:ThunderAgent实现2倍智能体推理加速 — togethercompute ·
- ICML 2026 Spotlight:ThunderAgent 实现智能体推理 2 倍提速 — togethercompute · 2026-07-30
- 【源头】Together Compute 发布多节点推理引擎,支持近线性扩展 — togethercompute · 2026-07-30
- 【源头】ICML 2026 论文 ThunderAgent:解决智能体推理 KV 缓存抖动 — togethercompute · 2026-07-30
- ThunderAgent 引擎实测:吞吐量翻倍,多节点扩展近乎线性 — togethercompute · 2026-07-30
- ICML 论文 ThunderAgent:多轮 Agent RL 吞吐量提升近 2 倍 — simran_s_arora · 2026-07-30
另有 1 条近重复转述:togethercompute