FlashRT:利用智能体优化多模态应用部署,B200延迟降低70倍

Krish Agarwal · hf · 2026-07-21

**FlashRT** 是一个旨在指导智能体部署实时多模态应用的框架,解决了异构模型流水线在多 GPU 环境下高效部署的难题。 - **核心痛点**:现有的服务系统和自动并行编译器转换能力有限,新应用通常需要手工编写高效的底层实现。 - **解决方案**:FlashRT 采用“程序链”范式,引导编码智能体将简单的参考实现转化为优化的多 GPU 部署。智能体提取中间表示(IR)捕获数据依赖,通过静态分析寻找候选转换,并在测量门控循环中迭代验证和基准测试。 - **实验结果**:在 NVIDIA B200 GPU 上,实现了最高约 70 倍的延迟降低和 2.8 倍的吞吐量提升。在 AMD MI355X GPU 上,吞吐量提升达 3.6 倍,证明了智能体驱动的优化在成熟度较低的平台更具扩展性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →