跨机房异构推理架构PDD

机器之心 · wechat · 2026-07-20

面向智能体的推理基础设施怎么做

这篇文章围绕“智能体时代”的推理瓶颈展开:用户不是只等一句回复,而是会经历多轮工具调用和上下文回传,所以每轮几秒的小延迟,乘上几十轮交互后,会变成整体工作流里十几分钟的劣化。

核心方案是 PDD(Prefill-RelayDecode-MainDecode):一种跨数据中心、异构的 PD 分离推理架构。文章强调,Prefill 更偏计算,Decode 更偏显存带宽和访存,因此把两者拆开,再让不同芯片各做擅长的部分,能更适合当前国产异构算力的现实。

关键结论

PDD 怎么工作

KV Cache 会双路传输:一条本地 RDMA 给 RLD,一条经 WAN/TCP 给 MD。RLD 会先输出一批 EagerOutputTokens,把远端传输的等待时间藏起来。

等 MD 收齐上下文后,它不需要把中间增量 KV Cache 全量搬过去,而是只接收 token ID,再在本地重算缺失的 KV,完成无缝交接。这样可以把跨机房交接的数据量压得很小,也更不怕网络抖动。

文中给出的数据

更大的战略叙事

文章把这套能力包装成“AgenticInfra”三层:

同时还提到,他们在做基础设施自己的智能体,比如平台管家、集群运维和算子生成,目标是让基础设施形成自我优化闭环。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →