ThunderAgent 引擎实测:吞吐量翻倍,多节点扩展近乎线性
togethercompute · x · 2026-07-30
Together Compute 推出的 ThunderAgent 引擎旨在解决复杂 Agent 工作流中的推理性能瓶颈。传统请求级引擎无法感知同一工作流中多次 LLM 调用的关联性,导致严重的 KV cache 抖动和级联重算问题。
ThunderAgent 通过引入程序级调度抽象来解决这一痛点:
- 智能调度:将整个 Agent 工作流视为可调度的程序,追踪其阶段、KV 内存占用和节点位置。在内存压力下自动暂停低优先级工作流,大幅提升缓存命中率。
- 单节点性能:在单台 8×H100 节点、batch 192 的测试中,相比 SGLang 降至 390 tok/s(延迟 65s),ThunderAgent 维持在 803 tok/s(延迟 10.6s),实现 2 倍吞吐量和约 6 倍的低延迟。
- 多节点扩展:从 16 GPU 扩展到 64 GPU 时,处理速度从 671 提升至 2248 steps/min,实现了近乎线性的性能扩展,且集群越大优势越明显(2 节点 1.79× 提速,8 节点 2.39× 提速)。
- 无缝集成:作为 drop-in 方案,兼容现有的 KV offloading 和投机解码配置,已被 SkyRL 和 NVIDIA Dynamo 采用。
所属事件:Together AI 推出 ThunderAgent 引擎实现智能体推理翻倍提速(5 条相关)→
「编程与Agent」频道最新
- dspy-monty-interpreter v0.3.0 发布,强化多线程与隔离执行 — dbreunig · 2026-07-30
- ShadKit:在 SwiftUI 中复刻 shadcn 风格的 AI 应用组件 — jasonkneen · 2026-07-30
- 别被忽悠了:当前AI智能体的记忆系统只是RAG套壳 — Trick_Stretch_4746 · 2026-07-30
- 模型还是框架更关键?资深开发者剖析AI Agent的三大流派 — AccBalanced · 2026-07-30
- 开源实战:为本地优先应用接入MCP的5个经验教训 — mkngsm · 2026-07-30
- 超越人类监督循环:AI Agent 有效治理的四大核心要素 — marigo · 2026-07-30