AWS 推出技能级 Agent 评测:查选错技能与漏步骤

AWS ML Blog · rss · 2026-09-23

AWS ML Blog 介绍如何用 Strands Evals SDK 与 Amazon Bedrock AgentCore Evaluations 评估「技能型(skill-equipped)」agent。技能是遵循开放 Agent Skills 标准的可复用指令集(通常存于 SKILL.md),打包了指令、工具绑定(API/MCP/本地命令)、知识、工作流与护栏,运行时按需加载,无需把全部流程塞进系统提示或微调模型。

这种可组合性带来两类通用输出质量指标抓不到的失败:一是选错技能,二是选对技能却跳过或只部分执行其步骤——两者都可能产出流畅但未使用既定领域知识的回答,因此不能只看最终回复。

新增三个评测器:

两类失败对应不同修法:选错往往源于技能描述重叠或含糊;遵循不全则可能需要更清晰的步骤、调整技能结构或换更强的模型。多技能运行仍可诊断,能定位是哪个技能拉低了总分;若未调用任何技能,基于 judge 的评测器不出分,需配合 SkillInvoked 做已知路由要求的回归测试。

文中给出 HR 助手示例(PTO 规划 vs 员工福利技能),并说明前置条件:Python 3.10+、具备 Bedrock InvokeModel 权限、安装 strands-agents-evals 与 strands-agents、AgentCore 侧需开启可观测性与 CloudWatch Transaction Search,示例用 AgentCore CLI。技能抽取已支持 Strands AgentSkills 插件、Claude Code、Claude Agent SDK、OpenAI Agents SDK、Codex、Gemini CLI、OpenHands、Google ADK 及通用 SKILL.md 读取。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →