NVIDIA Dynamo 推出会话感知推理:智能体 KV 缓存跨引擎复用

PyTorch · x · 2026-10-09

PyTorch 官方博客联合 NVIDIA 发布技术文章,介绍 NVIDIA Dynamo 如何针对智能体(agentic)负载改造推理服务栈。

核心问题:与单轮对话不同,一个编码智能体会话通常以数万 token 的大 prefill 开场(系统提示、工具定义等),且每轮都完整重发上下文;一个任务会扇出几十次模型调用和并行子智能体。会话的大部分时间其实花在等待工具执行上——期间上下文一直驻留在 KV cache 中,没有任何生成发生。服务效率的关键就在于:保留并复用多少驻留上下文、同时能撑住多少并发会话并满足亚秒级延迟目标。

方案:Dynamo 引入统一的会话级标识符(session-level identifier),把原来请求粒度的服务基础设施升级为「程序感知」系统,实现:

文章配合图表对比了标准聊天机器人与智能体工作流的流量形态差异,展示 Dynamo 的 router、推理引擎与 KV-cache 管理器如何端到端协同。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →