Lyft 的真实用户评测闭环

AI Engineer · youtube · 2026-07-19

Nick Ung 讲的是 Lyft 如何给客服/代理系统做更接近真实生产的评测。

核心问题是:很多离线 eval 太“容易”——测试里的“客户”只是普通 LLM,完全不像真实用户那样烦躁、跑题、对抗性强,所以上线后会暴露出离线测不出来的失败模式。

Lyft 的做法是:

他们的客服代理系统大约处理 Lyft 客服问题的三分之一,规模是每月数百万次对话。这个案例的重点不是某个单一模型,而是如何把评测做成可持续的工程系统。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →