自优化智能体提升B200推理吞吐量16%且不损精度

yisongyue · x · 2026-08-05

Asari AI 提出了一种利用自我改进智能体(co-inventors)来端到端优化 AI 推理栈的新方法。在 NVIDIA B200 GPU 上针对 DeepSeek V4 Pro 和 GLM-5.2 的测试表明,该系统在多个最大并发级别下,将吞吐量和交互性提升了 16%。

优化过程涵盖了内核、调度器、负载均衡器等整个推理栈。为了确保速度提升不以牺牲正确性为代价,系统采用了严格的分布级正确性检查,而非传统的标准基准测试。

此外,Artificial Analysis 宣布推出端点准确度指数,旨在衡量无服务器 API 端点在多大程度上保留了开源模型的原生准确度,帮助开发者基于精度而不仅仅是价格和速度来选择服务商。

所属事件:Asari AI 推出自优化智能体提升大模型推理吞吐量(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →