AWS教程:用AgentCore评估+GitHub Actions给AI代理加CI质量门
AWS ML Blog · rss · 2026-09-09
AWS ML Blog 发布完整教程,演示如何为部署在 Amazon Bedrock AgentCore 上的 AI agent 搭建 CI/CD 质量门,防止 prompt 或配置改动导致质量回退:
- 架构:Strands agent 与 MCP server 部署在同一 Cognito 用户池后的两个 AgentCore runtime 上,MCP 工具带三层角色权限控制;用户流走 authorizationcode 且强制角色门控,CI 的 M2M 流走 clientcredentials(全工具访问、无角色检查)。
- 评估层:AgentCore Evaluations 以 LLM-as-a-judge 读取 CloudWatch 的 OpenTelemetry traces 打分,支持三种模式——按需评估(驱动 CI 质量门)、在线评估(生产流量持续监控)、批量评估(基线与回归测试)。
- 评估器四类:内置(Helpfulness、Correctness、ToolSelectionAccuracy、轨迹比对等)、自定义 LLM judge、Lambda 代码评估(正则/schema 等确定性检查)、第三方(DeepEval、AutoEval)。
- GitHub Actions 用 OIDC 短期凭证假设 IAM 角色,评估分数低于阈值(如 0.8/1.0)则 PR 被阻断。参考实现仓库已开源。
「编程与Agent」频道最新
- Nex 开源 N2.5 智能体模型家族:最大 1.6T MoE,逼近 Claude Opus 5 — multimodalart · 2026-09-09
- Codex 会现写工具调用代码:作者实测发现 agent 新失败点 — srchvrs · 2026-09-09
- 研究:通用编码 Agent 能力领先专用数据 Agent 37 分,仅 1/4 交互轮次 — RishiBommasani · 2026-09-09
- 让 GPT-6 Astra 下棋的开源配置来了:Codex 加自制工具与 skills — MikePFrank · 2026-09-09
- Weaviate 教程:不动原文件,把混乱创意素材库变成语义可搜索库 — philipvollet · 2026-09-09
- 工厂工人用 Gemma 31b「养」出一个本地 AI:自建触觉读 GPU 温度,还写博客 — D33lix · 2026-09-09