ICML 2026 Spotlight:ThunderAgent实现2倍智能体推理加速
togethercompute · x · 2026-07-30
Together AI 团队提出 ThunderAgent,一种针对大规模智能体推理的高吞吐量系统。该系统引入了全新的程序级抽象来调度智能体 LLM 请求,有效消除了 KV cache 抖动问题。
核心性能数据:
- 单节点吞吐量提升超 2 倍,且在高并发下 P50 延迟降低约 10 倍。
- 在 8 节点集群上实现 2.4 倍加速,从 16 到 64 个 GPU 呈现近乎线性的吞吐量扩展能力。
工程落地:
- 作为即插即用组件,仅需添加一个 programid 字段即可兼容现有引擎配置(如 KV 卸载和投机解码)。
- 格式无关设计,目前已支持 OpenAI chat completions API,且已被 SkyRL 和 NVIDIA Dynamo 采用。
该工作已被 ICML 2026 收录为 Spotlight 论文。
所属事件:Together AI 推出 ThunderAgent 引擎实现智能体推理翻倍提速(5 条相关)→
「Infra」频道最新
- Buildcleaner 开源工具可清理 443GB 构建缓存,免费 MIT 许可 — jasonkneen · 2026-07-30
- 大模型推理成本骤降:B200 单价已跌破 3 美元 — AccBalanced · 2026-07-30
- Yann LeCun 等探讨:LLM 是新型编译器,性能取决于算力 — yisongyue · 2026-07-30
- 高盛预测AI Token月处理量到2030年将激增70倍 — Beth_Kindig · 2026-07-30
- 244 GiB 大模型冷启动实测:耗时约 154 秒 — QuixiAI · 2026-07-30
- FP8 统一用于训练与推理解码,RL 端到端提速 16% — joecole · 2026-07-30