vLLM 实测:Agent 会话中位 43 轮,输入 142K 输出仅 444 token
vllm_project · x · 2026-09-09
vLLM 基于真实编码 Agent 追踪数据揭示 agentic 流量特征:
- 会话中位 43 轮
- 中位输入 142K token,输出仅 444 token
- 前缀缓存命中率超 96%
- 44% 的会话会 fork 子 agent
特征是「长前缀、极短输出、大量复用」。配套数据显示 DeepSeek V4 Pro 在严格 p90 交互性 SLO(每用户 50+ tok/s)下单 GPU 每秒可承载 83K token,前沿档达 130K;同等缓存命中率下服务 Opus 5 成本高 106 倍,说明为开源权重模型调优推理栈的空间巨大。
所属事件:vLLM 发布 AgentX 实测:真实 Agent 负载优化带来最多 106 倍成本优势(5 条相关)→
「编程与Agent」频道最新
- Anthropic 用 Claude Tag 当 CI/CD 故障值班一线响应 — ClaudeDevs · 2026-09-09
- 详解 Anthropic 的 Claude 值班agent:3分钟定位CI故障 — ClaudeDevs · 2026-09-09
- altryne 发现 agent 项目藏着 soul.md,致敬 Steinberger 的影响力 — altryne · 2026-09-09
- Mitchell Hashimoto 演示远程持久会话工具 Superlogical:可完全替代 SSH — iannuttall · 2026-09-09
- LLM 排版总溢出?工程师用测量-修复回路驯服单页生成 — Scholeristical · 2026-09-09
- OpenClaw 2.0 后恢复高频发版,新版本支持浏览器自动化实况观看 — heyneighbor · 2026-09-09