Agent 评测只看输出对错就够了吗?社区激辩决策级评估

KAIT2_1412 · reddit · 2026-08-21

一位正在开发带真实成本的 agent(支付供应商/验证/上报)的开发者在 Reddit 提问:现有 agent eval 工具(DeepEval、faithfulness 评分等)大多只判断输出好坏,pass/fail 过于粗糙。他举出一个关键反差:错误的「支付」会亏钱,错误的「上报」只浪费十分钟,两者在现实中的代价天差地别,但在 pass/fail 体系里都算 fail。他向社区求解:是否该给不同失败类型挂真实成本权重?是否该校验 agent 置信度的校准度?还是业界其实仍在「demo 看着对就上线」?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →