AWS 提出 AEM 指标:按轮次分解定位多轮 Agent 对话的级联错误根因

AWS ML Blog · rss · 2026-09-10

AWS ML Blog 介绍 Agent Evaluation Metric(AEM),一种可分解、按轮次衡量的多轮 Agent 质量指标,首个维度是正确性。

问题:多轮对话中一个早期错误会静默级联污染后续所有轮次;任务级评估只看最终结果,无法区分根因与下游受害者。现有指标(goal completion、LLM-as-judge)把质量当单一信号,拆不出事实错误/信息缺失/工具选错。

AEM 方法:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →