AWS 双层监控方案:LLM 评审打分加自主排障,盯住生产级多智能体

AWS ML Blog · rss · 2026-09-12

AWS 工程博客指出,多智能体系统在生产环境的故障常被传统基础设施监控漏掉:比如 supervisor 的 prompt 划定不当不会报错,只会把 20% 请求路由给错误的专家 agent;IAM 权限缺失时 agent 返回空响应但日志全是成功的工具调用。CloudWatch 只能证明「系统执行了」,无法证明「agent 帮用户达成了目标」。

作者用一个四专家 agent 的航空订票系统(多城市预订、常旅客权益、差旅合规,需在单轮对话内并行协调)演示双层监控架构:AgentCore Evaluations 用 LLM-as-a-Judge 持续给线上交互打分(有用性、正确性、目标完成度),每个分数附带推理依据;质量下滑时自动做低分会话模式分析,定位「总选错工具」「格式不友好」等失败模式并给出 prompt/编排修改建议。AWS DevOps Agent 则像值班工程师,跨服务边界自动拉取 CloudWatch 日志、构建资源拓扑图、关联 IAM 策略与调用链,把「空响应」定位到「缺某条 IAM 权限」,给出修复建议。

技术栈包括 AgentCore runtime(内建 OpenTelemetry 观测)、Strands Agents SDK(Swarm/Graph/Agents-as-Tools 编排模式)和 FAST 全栈模板。两层合起来构成「监控→分析→改进→部署」的持续反馈闭环。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →