ICML 2026 Spotlight:ThunderAgent 实现智能体推理 2 倍提速
togethercompute · x · 2026-07-30
Together AI 推出了 ThunderAgent,这是一个面向大规模智能体推理的高吞吐量系统,已被 ICML 2026 接收为 Spotlight 论文。
该系统引入了全新的程序级调度抽象,有效解决了多轮工具调用中的 KV cache 抖动问题。
核心性能数据:
- 单节点吞吐量提升超 2 倍,在高并发下 P50 延迟降低约 10 倍。
- 在 8 节点集群上实现 2.4 倍加速,从 16 到 64 个 GPU 具备近线性的扩展能力。
工程兼容性:
- 作为 Drop-in 替换方案,仅需添加一个 programid 字段即可无缝接入现有引擎配置(如 KV offloading 和投机解码)。
- 格式无关设计,目前已原生支持 OpenAI chat completions 接口,并被 SkyRL 和 NVIDIA Dynamo 采用。
所属事件:Together AI 推出 ThunderAgent 引擎实现智能体推理翻倍提速(5 条相关)→
「Infra」频道最新
- Buildcleaner 开源工具可清理 443GB 构建缓存,免费 MIT 许可 — jasonkneen · 2026-07-30
- 大模型推理成本骤降:B200 单价已跌破 3 美元 — AccBalanced · 2026-07-30
- Yann LeCun 等探讨:LLM 是新型编译器,性能取决于算力 — yisongyue · 2026-07-30
- 高盛预测AI Token月处理量到2030年将激增70倍 — Beth_Kindig · 2026-07-30
- 244 GiB 大模型冷启动实测:耗时约 154 秒 — QuixiAI · 2026-07-30
- FP8 统一用于训练与推理解码,RL 端到端提速 16% — joecole · 2026-07-30