vLLM 实测:Agent 会话中位 43 轮,输入 142K 输出仅 444 token

vllm_project · x · 2026-09-09

vLLM 基于真实编码 Agent 追踪数据揭示 agentic 流量特征:

特征是「长前缀、极短输出、大量复用」。配套数据显示 DeepSeek V4 Pro 在严格 p90 交互性 SLO(每用户 50+ tok/s)下单 GPU 每秒可承载 83K token,前沿档达 130K;同等缓存命中率下服务 Opus 5 成本高 106 倍,说明为开源权重模型调优推理栈的空间巨大。

所属事件:vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →