评测分数 0.94 却照样失败:Conviva 谈 agent 评测的盲区与补救
Automatic-Mirror7324 · reddit · 2026-09-10
Conviva 团队复盘:其分析类 agent 在 2026 世界杯期间服务 20 家大型流媒体平台、数千万人并发查询实时数据,评测套件覆盖良好、分数漂亮,却几乎没帮他们发现生产环境中的真实故障。
问题根源:测试用例都来自「看得见的失败」(异常、超时、抱怨、点踩),而最贵的失败是安静的——对话看起来完全正常、helpfulness/relevancy 打 0.94+ 分,实则 agent 静默漏传了一个可选搜索参数,用户自己手动搜完就走,这条轨迹永远不会成为测试用例。
他们的解法:
- 不再只评 agent 说了什么,转而看用户接下来的行为:是否重述请求、重复提问、降低诉求(范围收窄)、事后手动验证、在系统标记已解决后又回来纠正——这些信号无需人工标注,也无法被「更好听的回答」骗过;
- 从「哪条 trace 失败」转为「在什么条件下失败」:按请求类型、工具参数、用户层级切片找分歧点,先统计后看 trace,逐条读轨迹和抽样恰恰会漏掉稀有而昂贵的失败。
「编程与Agent」频道最新
- 自研智能体 Astra 自带国际象棋工具,挑战 ELO 2000 级棋手 — MikePFrank · 2026-09-10
- LangChain 演示:10 分钟配好 Deep Agents 托管连接 — LangChain · 2026-09-10
- Altman:Astra 用电脑的能力已达到人类水平 — airesearch12 · 2026-09-10
- GPT-6 Astra 实测:词级时间轴让智能体视频剪辑不切词 — _AustinCalvert_ · 2026-09-10
- 开源 skill 一句话生成专业深色系统架构图 — tom_doerr · 2026-09-10
- OpenAI DX 团队用 Render 撑住数百万周访问量的玩法公开 — kagigz · 2026-09-10