vLLM发布AgentX实测:服务成本较Opus 5 API低最多106倍
vllm_project · x · 2026-09-09
vLLM 团队联合 Inferact 发布长文,系统讲解如何针对真实 Agent 工作负载优化推理服务栈。要点:
- 背景:Agent 流量已成 vLLM 主要来源。多轮会话、长上下文和大量前缀复用,对 KV cache 管理、并行策略和引擎优化提出全新要求。2026 年 6 月 OpenAI 数据显示,企业客户中 Codex 已占 Codex+ChatGPT 输出 token 的 64%。
- 成绩:在 SemiAnalysis 的公开 AgentX 基准上,vLLM 在 DeepSeek V4 Pro 上达到 130K tokens/GPU·秒,在 MiniMax M3 上交互性达 376 tokens/s;对比 Opus 5 API 定价,DeepSeek V4 Pro、MiniMax M3、Kimi K3 三模型的服务成本优势为 14.6×–106×。
- 踩坑经验:流水线并行适合冷启动长 prompt,但在只追加几百 token 的热 Agent 轮次中,流水线气泡会吃掉收益;Decode 上下文并行在 Kimi K3 上有效但在 DeepSeek V4 上只与 DEP 打平——并行策略必须跟随模型注意力结构;负载均衡并不总是胜过简单的会话粘性路由。
- 所有数据均在公开 dashboard 上可复现,覆盖 GB300 NVL72 与 B300,配置公开。
所属事件:vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势(5 条相关)→
「Infra」频道最新
- 就算 OpenAI 倒闭也挡不住 AI 建设:GPU 只会换手加速扩张 — markjeffrey · 2026-09-09
- 2x RTX 2060 跑 Qwen3.8 27B 达 45 tok/s,值得换 AMD 6800 双卡吗 — BarberIcy366 · 2026-09-09
- Coval 语音基准:Baseten STT 比 OpenAI 快约 5 倍且错误率最低 — baseten · 2026-09-09
- 2×4090 本地跑 Agent 实测:软上限 5 个@64k,硬上限 9 个 — Iamisseibelial · 2026-09-09
- exe.dev 深度解析:一条 ssh 命令秒开带持久盘的 Linux 沙盒 — davidcrawshaw · 2026-09-09
- GPT-6 Astra 登陆 Amazon Bedrock:百万 token 上下文,首达网络安全 Critical 级 — AWS ML Blog · 2026-09-09