NVIDIA Dynamo 推出会话感知推理:智能体 KV 缓存跨引擎复用
PyTorch · x · 2026-10-09
PyTorch 官方博客联合 NVIDIA 发布技术文章,介绍 NVIDIA Dynamo 如何针对智能体(agentic)负载改造推理服务栈。
核心问题:与单轮对话不同,一个编码智能体会话通常以数万 token 的大 prefill 开场(系统提示、工具定义等),且每轮都完整重发上下文;一个任务会扇出几十次模型调用和并行子智能体。会话的大部分时间其实花在等待工具执行上——期间上下文一直驻留在 KV cache 中,没有任何生成发生。服务效率的关键就在于:保留并复用多少驻留上下文、同时能撑住多少并发会话并满足亚秒级延迟目标。
方案:Dynamo 引入统一的会话级标识符(session-level identifier),把原来请求粒度的服务基础设施升级为「程序感知」系统,实现:
- 会话感知路由(session-aware routing)
- 跨 worker 的共享 KV cache 索引
- KV cache 在 vLLM 与 SGLang 之间跨引擎的程序化迁移
文章配合图表对比了标准聊天机器人与智能体工作流的流量形态差异,展示 Dynamo 的 router、推理引擎与 KV-cache 管理器如何端到端协同。
「编程与Agent」频道最新
- 2026 年 20 个 AI Agent 记忆工具盘点:从 Mem0 到 Graphiti 分五类讲清选型 — MaryamMiradi · 2026-10-09
- scikit-learn 创始人谈 coding agent:像咖啡,让人更快地犯蠢 — GaelVaroquaux · 2026-10-09
- Matt Pocock 吐槽 Anthropic 插件市场:用户被卡在旧版本 — mattpocockuk · 2026-10-09
- 开源项目 Alook:让本地编码 Agent 互发消息协作 — rohanpaul_ai · 2026-10-09
- TypeSafe 推出决策模型 Jev:分类任务快 200 倍、成本低 400 倍 — LangChain · 2026-10-09
- PASSTHROUGH 神技:用双 mod 让 Minecraft 跑进艾尔登法环 — aestheticedwar1 · 2026-10-09