AWS 推出技能级 Agent 评测:查选错技能与漏步骤
AWS ML Blog · rss · 2026-09-23
AWS ML Blog 介绍如何用 Strands Evals SDK 与 Amazon Bedrock AgentCore Evaluations 评估「技能型(skill-equipped)」agent。技能是遵循开放 Agent Skills 标准的可复用指令集(通常存于 SKILL.md),打包了指令、工具绑定(API/MCP/本地命令)、知识、工作流与护栏,运行时按需加载,无需把全部流程塞进系统提示或微调模型。
这种可组合性带来两类通用输出质量指标抓不到的失败:一是选错技能,二是选对技能却跳过或只部分执行其步骤——两者都可能产出流畅但未使用既定领域知识的回答,因此不能只看最终回复。
新增三个评测器:
- Skill Selection Accuracy:判断每次调用的技能是否适合任务,按技能返回二值结果。
- Skill Instruction Following:判断 agent 对技能指令的遵循程度,按每个规定步骤给出五级评分并附证据。
- Skill Invoked(仅 Strands Evals):确定性检查某命名技能是否成功加载,不调用模型。
两类失败对应不同修法:选错往往源于技能描述重叠或含糊;遵循不全则可能需要更清晰的步骤、调整技能结构或换更强的模型。多技能运行仍可诊断,能定位是哪个技能拉低了总分;若未调用任何技能,基于 judge 的评测器不出分,需配合 SkillInvoked 做已知路由要求的回归测试。
文中给出 HR 助手示例(PTO 规划 vs 员工福利技能),并说明前置条件:Python 3.10+、具备 Bedrock InvokeModel 权限、安装 strands-agents-evals 与 strands-agents、AgentCore 侧需开启可观测性与 CloudWatch Transaction Search,示例用 AgentCore CLI。技能抽取已支持 Strands AgentSkills 插件、Claude Code、Claude Agent SDK、OpenAI Agents SDK、Codex、Gemini CLI、OpenHands、Google ADK 及通用 SKILL.md 读取。
「编程与Agent」频道最新
- OpenAI 发布 GPT-6 Sol 与 Luna,API 价格永久下调 50% — aziz4ai · 2026-09-23
- Claude Opus 5.5 一条 prompt 生成 10v10《光环》风多人射击游戏 — Scobleizer · 2026-09-23
- UX 之后是 AX:开发者列出让服务对 Agent 友好的四项清单 — kleffew94 · 2026-09-23
- Opus 5.5 写出 3MB 单文件游戏:实时程序化复刻安提基特拉机械 — edwinarbus · 2026-09-23
- Grok Build 1.0.41 发布:Grok 4.7 上线并强化子代理控制 — elonmusk · 2026-09-23
- GPT-6 沿用 Astra 缓存机制:调节推理力度不再击穿缓存 — brandon_galang · 2026-09-23