NVIDIA 披露 agent 推理缓存账:Claude Code 命中率 85-97%,读写比 11.7 倍

_ScottCondron · x · 2026-08-23

NVIDIA 技术博客发布《Full-Stack Optimizations for Agentic Inference with Dynamo》,讲如何让自托管开源模型获得托管 API 级的 agent 推理优化。

为什么难:编码 agent 正在生产环境大规模写代码——Stripe 的 agent 每周产出 1300+ PR,Ramp 30% 的合并 PR 来自 agent,Spotify 每月 650+。Claude Code 一个会话要发数百次 API 调用且每次携带全部对话历史,KV cache 压力巨大。

关键数据:首次调用写入对话前缀后,后续调用可命中 85-97% 缓存;4 个 Opus 队友协作时聚合命中率 97.2%,读写比达 11.7 倍——典型的 write-once-read-many 模式。核心优化目标就是最大化跨 worker 的缓存复用、保持 KV 块温热可路由。

Dynamo 的做法:从三层把 Dynamo 做成 agent-native——前端 API、路由器和 KV cache 管理,让自建 GPU 集群也能拿到托管基础设施才有的 prefix 匹配、缓存放置与驱逐能力。

所属事件:NVIDIA 披露 Agent 推理优化:缓存命中率高达 97%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →