自优化智能体提升B200推理吞吐量16%且不损精度
yisongyue · x · 2026-08-05
Asari AI 提出了一种利用自我改进智能体(co-inventors)来端到端优化 AI 推理栈的新方法。在 NVIDIA B200 GPU 上针对 DeepSeek V4 Pro 和 GLM-5.2 的测试表明,该系统在多个最大并发级别下,将吞吐量和交互性提升了 16%。
优化过程涵盖了内核、调度器、负载均衡器等整个推理栈。为了确保速度提升不以牺牲正确性为代价,系统采用了严格的分布级正确性检查,而非传统的标准基准测试。
此外,Artificial Analysis 宣布推出端点准确度指数,旨在衡量无服务器 API 端点在多大程度上保留了开源模型的原生准确度,帮助开发者基于精度而不仅仅是价格和速度来选择服务商。
所属事件:Asari AI 推出自优化智能体提升大模型推理吞吐量(2 条相关)→
「编程与Agent」频道最新
- BBVA与Sierra合作,30天快速上线客服Agent — saranormous · 2026-08-05
- 开源多智能体架构sol-advisor:用Opus统筹规划 — daniel_mac8 · 2026-08-05
- AI智能体6分33秒速通10层LLM安全攻防挑战 — adamamcbride · 2026-08-05
- Cloudflare 推出 Agent Wallet,为智能体提供原生支付工具 — daluoseo · 2026-08-05
- Mac 原生 Agent 构建器集成 MCP:支持 Claude/GPT 与本地模型 — ahumanbeingmars · 2026-08-05
- 解决 Agent 写入权限隐患:开源安全网关 mcipip 设计思路 — Ok_Anxiety410888 · 2026-08-05