评测分数 0.94 却照样失败:Conviva 谈 agent 评测的盲区与补救

Automatic-Mirror7324 · reddit · 2026-09-10

Conviva 团队复盘:其分析类 agent 在 2026 世界杯期间服务 20 家大型流媒体平台、数千万人并发查询实时数据,评测套件覆盖良好、分数漂亮,却几乎没帮他们发现生产环境中的真实故障。

问题根源:测试用例都来自「看得见的失败」(异常、超时、抱怨、点踩),而最贵的失败是安静的——对话看起来完全正常、helpfulness/relevancy 打 0.94+ 分,实则 agent 静默漏传了一个可选搜索参数,用户自己手动搜完就走,这条轨迹永远不会成为测试用例。

他们的解法:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →