Agent 工作负载令 KV cache 成存储难题:读写比达 11.7 倍
AccBalanced · x · 2026-10-06
随着 agent 对话变长、跨轮次保留更多状态,可复用的 KV cache 正溢出到 HBM、CPU 内存、闪存等多层存储,形成一种独特的流量模式。
- Nvidia Dynamo 团队分析的一个 42 次 tool-call 的 Claude Code 会话:89.1 万次 cached-token 读 vs 仅 7.6 万次写,读写比 11.7×
- 这说明 KV cache 已是独立的基础设施问题,而非推理栈内的小型缓存优化
- Nvidia 的 CMX 是专为这类 KV 流量设计的 pod 级以太网挂载闪存层;Dynamo 的 KVBM 可在 GPU 显存、CPU 内存、磁盘与对象存储之间分层 KV
核心原因:多轮 agent 生成大量可复用状态,系统必须决定各层存储间如何放置与调度这些 KV 数据。
「编程与Agent」频道最新
- Cursor Cloud Agents API 新增环境增删查端点,进入公开测试 — tetsuoai · 2026-10-06
- OpenCode 上线 16 个月月活突破 1700 万 — ycombinator · 2026-10-06
- Claude Code 2.1.291 修复云端会话丢回复与退出丢消息两个回归 — ClaudeCodeLog · 2026-10-06
- 一张图拆解 AI Agent 架构:感知、推理、规划等 7 大模块 — ZabihullahAtal · 2026-10-06
- Memoria 1.0 发布:纯本地模型无关记忆层,LongMemEval Recall@1 达 89.8% — kitkatz69 · 2026-10-06
- 作者翻出 4 年前写的 UE5 AutoLOD 工具,适配 GenAI 3D 资产优化 — rms80 · 2026-10-06