AWS 提出 AEM 指标:按轮次分解定位多轮 Agent 对话的级联错误根因
AWS ML Blog · rss · 2026-09-10
AWS ML Blog 介绍 Agent Evaluation Metric(AEM),一种可分解、按轮次衡量的多轮 Agent 质量指标,首个维度是正确性。
问题:多轮对话中一个早期错误会静默级联污染后续所有轮次;任务级评估只看最终结果,无法区分根因与下游受害者。现有指标(goal completion、LLM-as-judge)把质量当单一信号,拆不出事实错误/信息缺失/工具选错。
AEM 方法:
- 正确性分解为两个子指标:Truthfulness(值/陈述与预期事实一致)与 Completeness(参数与信息无缺失),底层是工具/动作选择的结构检查
- 每轮分为响应轮与动作轮,同一层级套用:响应轮查文本覆盖与事实性,动作轮查参数键与参数值
- 轮次判定为二元 pass/fail 并给出具体失败原因;整对话得分为通过轮次占比,衰减可归因到具体子指标
- 语义比较而非精确匹配:「NYC」与「New York City」等价;可用 embedding 相似度(快、便宜)或 LLM-as-judge(更细),阈值 0.5 为中性默认值,按领域误报/漏报容忍度调节
- 分解-评估-组合的模式可扩展到安全、指令保持、推理深度等新维度
「编程与Agent」频道最新
- Claude Code 桌面版支持任意面板弹出独立窗口 — ClaudeDevs · 2026-09-11
- 「向零冲刺」:DHH 提议给极速构建发游戏徽章 — AnushElangovan · 2026-09-11
- 开源 AI 交易终端 CloddsBot:一个 Claude 驱动跨 1000+ 市场自动交易 — tom_doerr · 2026-09-11
- 让多个 LLM 开「群聊」互相辩论,替代手动复制粘贴 — crua9 · 2026-09-11
- GitHub Copilot Day 直播进行中:短平快场次连轴演示 Copilot 新能力 — martinwoodward · 2026-09-11
- 推理提速改变 Agent 工作流:Cerebras 实测并行代理更少、产出不降 — MatthewBerman · 2026-09-11