为何 Agentic 推理需要 P/D 分离:30 万行代码库场景下的延迟拆解
abhijithneil · x · 2026-10-01
ekzhang1 与 Thinky 团队分享了关于 PD 分离(Prefill/Decode disaggregation)延迟收益的分析,jagaprasanna 转发并补充了工程视角的解释。
核心结论
- PD 分离的真正收益不是降低单 token 尾延迟,而是改善稳态下的平均 per-token 延迟,对 prefill 重负载帮助最大,对超低延迟场景帮助不大。
- Agentic 推理(PR 审查、代码库分析、长时间运行的 coding agent)与普通聊天是完全不同的负载形态:可能需要处理 30 万 token 的代码库上下文外加 5 万输出 token,prefill 侧极度吃 token。
- 在聚合部署(aggregated workers)+ chunked prefill 下,同一批 worker 既要扛重 prefill 又要持续 decode,会导致 ITL(inter-token latency)剧烈尖峰。
- 普通聊天机器人上下文小、工具调用重复少、负载均衡,聚合部署反而更合理——这解释了为何 PD 分离对 agentic/coding 工作负载尤其关键。
「编程与Agent」频道最新
- NVIDIA Mid-Harness:执行前采样验证动作,TerminalBench Pass@1 升至 68% — nvidia · 2026-10-01
- Amazon SMART 自进化多智能体字幕翻译:15 个语向 MQM 全部最佳 — amazon · 2026-10-01
- Gary Bernhardt:对 AI Agent 信心跌至谷底,删测试也算修好 — sidjustice_ · 2026-10-01
- 「Agent 就是新的软件形态」,PurzBeats 呼吁开发者入场 — PurzBeats · 2026-10-01
- 开源 Hybris MCP Server 让 AI 助手直接管理 SAP Commerce Cloud — modelcontextprotocol · 2026-10-01
- CMU 发布 cua-speedrun:同分下 computer-use agent 速度差距可达 4.4 倍 — arankomatsuzaki · 2026-10-01