论文实测生产级 Agent:非 LLM 组件成延迟主因
dair_ai · x · 2026-08-20
DAIR.AI 推荐一篇面向生产级 agent 构建的论文,核心是弄清 agent 系统中真正的成本来源。
关键发现(基于 10 个插桩的 agentic 应用):
- 非 LLM 组件主导延迟:10 个应用中有 5 个的延迟主要由非 LLM 部分造成;同一应用内任务延迟在不同瓶颈(GPU 推理、内存受限检索、CPU 沙箱)间相差最高 32 倍。
- 状态驻留浪费:生产会话的状态在活跃步骤之间空闲数分钟到数小时;sandbox 工作集单会话峰值达 28 GB。
- 控制面税:辅助 LLM 调用和工具 schema 开销挤占了有效计算。
优化收益:任务感知 serving 降低延迟 29–40%;状态卸载节省内存 4.6 倍;工具结果缓存消除 35.2% 的冗余搜索调用。
「Infra」频道最新
- LithosAI 推出超快推理,Kimi K3 达 800+ tokens/s — JiaZhihao · 2026-08-20
- Baseten 招聘:推理将成史上最大市场 — philipkiely · 2026-08-20
- Qwen3.8-27B 模型部署每小时仅需 5 美元 — victormustar · 2026-08-20
- 美农村居民抗议数据中心,科技巨头转向农村营销 — dinabass · 2026-08-20
- 初创公司帮华尔街给 AI 算力定价,应对成本波动 — TechCrunch AI · 2026-08-20
- AI 耗电 10 倍于搜索,算力扩张面临能源基建断供 — ingliguori · 2026-08-20