微软披露1350万次Copilot会话:Agent调度不能照搬Chat
rohanpaul_ai · x · 2026-08-09
微软最新论文分析了 GitHub Copilot 的 1350 万次生产会话,指出编码智能体的基础设施调度策略不应与普通聊天请求混为一谈。
- 调用分布:高达 87% 的 LLM 调用由 Agent 自主发起,而非用户直接触发。单次用户提问会扇出大量模型调用、工具执行与重试。
- KV Cache 特征:缓存命中率高度依赖工作流位置。在同一轮对话内,首次调用命中率约 45%,第三次及之后跃升至 92-94%;但在跨轮次边界处骤降至 55%,切换模型时更是跌至 8%。
- 闲置时间:轮次内的中位缓存闲置时间仅 1.2 秒,跨轮次则高达 172 秒;容器闲置时间也从 5.8 秒飙升至 243 秒。
- 调度建议:基于轮次和会话级特征,论文提出的轻量级预测器能捕获 86-90% 的总闲置时间。基础设施应基于工作流状态进行调度,以优化缓存卸载和容器回收。
「Infra」频道最新
- 摩根大通:AI 芯片五年需超 2 万亿美元,推升债券市场 — rohanpaul_ai · 2026-08-09
- 斯坦福崔屹演讲:AI数据中心储能的三大破局路线 — FinanceYF5 · 2026-08-09
- DeepSeek V4 Flash 本地量化跑分:MacBook 运行实测 — corruptbytes · 2026-08-09
- 对比牛肉与数据中心:AI 耗水争议背后的双重标准 — KrustyKrabFormula_ · 2026-08-09
- 零成本本地部署大模型:5步替代 ChatGPT Plus — Aiden_Tech_Ai · 2026-08-09
- 英伟达 Rubin Ultra 架构调整:削减 HBM 转向光互连 — zephyr_z9 · 2026-08-09