跨机房异构推理架构PDD
机器之心 · wechat · 2026-07-20
面向智能体的推理基础设施怎么做
这篇文章围绕“智能体时代”的推理瓶颈展开:用户不是只等一句回复,而是会经历多轮工具调用和上下文回传,所以每轮几秒的小延迟,乘上几十轮交互后,会变成整体工作流里十几分钟的劣化。
核心方案是 PDD(Prefill-RelayDecode-MainDecode):一种跨数据中心、异构的 PD 分离推理架构。文章强调,Prefill 更偏计算,Decode 更偏显存带宽和访存,因此把两者拆开,再让不同芯片各做擅长的部分,能更适合当前国产异构算力的现实。
关键结论
- 在真实 agentic 负载里,前缀命中率往往很高,因此跨集群传输在经济上可行。
- 文中给出的基准里,64K 场景下同机房 PD 分离的 P50 TTFT 约 4.2 秒;把 Decode 放到另一座城市后,P50 变成 6.7 秒。
- 在尾部请求上,不做优化的跨集群方案会到 P90 18.3 秒、P99 29.7 秒,已经逼近高质量 token 服务的延迟上限。
PDD 怎么工作
- P 实例:在集群 A 做 Prefill。
- RLD 实例:同在集群 A,用 RDMA 快速接收 KV Cache,先开始解码,用来掩盖广域网延迟。
- MD 实例:位于远端集群 B,稍后接管主解码。
KV Cache 会双路传输:一条本地 RDMA 给 RLD,一条经 WAN/TCP 给 MD。RLD 会先输出一批 EagerOutputTokens,把远端传输的等待时间藏起来。
等 MD 收齐上下文后,它不需要把中间增量 KV Cache 全量搬过去,而是只接收 token ID,再在本地重算缺失的 KV,完成无缝交接。这样可以把跨机房交接的数据量压得很小,也更不怕网络抖动。
文中给出的数据
- 交接微基准对比了两种方式:通过广域网直传 4649KB 的增量 KV Cache,和只传 1.5KB 的 token ID 后本地重算。
- 直传方案平均有时更快,但抖动和峰值更大;本地重算更稳,网络波动影响也更小。
- 作者声称,在其测量环境里,这套方案可带来 51.5% TTFT 降低 和 37.5% 单 Token 成本下降。
更大的战略叙事
文章把这套能力包装成“AgenticInfra”三层:
- 算力集散中心:统一汇聚和调度异构算力。
- Token 工厂:把大模型推理做成高效率的 token 生产。
- AI 生产力商店:把基础设施能力封装成行业解决方案。
同时还提到,他们在做基础设施自己的智能体,比如平台管家、集群运维和算子生成,目标是让基础设施形成自我优化闭环。
「编程与Agent」频道最新
- Claude 新增录屏技能,可复现你的工作流程 — CodeByPoonam · 2026-07-22
- Devin 接入 e2b 沙箱,支持远程 agent 执行 — badphilosopher · 2026-07-22
- Hermes Agent 架构重构提案:拆分单体与事件总线解耦 — Promptmethus · 2026-07-22
- ty 现在可读取 Pydantic 配置关键字和字段元数据 — charliermarsh · 2026-07-22
- Pensar推出AI安全智能体:自动挖掘0day并完成修补 — andriy_mulyar · 2026-07-22
- ty 加入 Pydantic 一等支持,区分严格与宽松模式 — charliermarsh · 2026-07-22