Agent 真正贵在系统层
krishnan · x · 2026-07-13
这篇长文的核心观点是:agentic AI 之所以难用,不是模型不够强,而是围绕聊天场景搭建的系统架构不适合 agent。
作者引用 Google Cloud 的 2026 State of AI Infrastructure 报告,提到几组关键数据:
- 调查了 1400 多位高级 IT 负责人。
- 只有 17% 对现有技术栈能支持关键业务级 agent 有完全信心。
- 62% 的受访者认为数据外流、存储膨胀和闲置专用硬件会带来很高的推理成本。
- 81% 认为运维复杂度是 agent 扩展中的隐藏成本。
文章进一步指出,agent 的真实成本不只是 token,而是 token 加上上下文搬运、检索、编排、重试和审计。模型降价,并不自动等于工作流降价;如果一个任务会触发大量后续动作,完成一次任务的总成本甚至可能上升。
作者给出的架构建议包括:
- 按任务路由到合适的模型和芯片。
- 尽量让上下文靠近工作流。
- 记录 agent traces,而不只是应用日志。
- 把重试和工具失败当作成本驱动因素来衡量。
- 把审批和权限视为运行时的一部分,而不是静态政策文档。
结论是:未来的赢家不是“agent 最多”的公司,而是能以可预测的成本、延迟、可靠性和 blast radius 运行 agent 的公司。
所属事件:分析称多模型编排层才是AI Agent护城河(2 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11