Airbnb 公开内部 AI 评测栈:日抽样 5% 流量

econoar · x · 2026-08-04

Airbnb 公开了内部 AI 评估栈:先程序校验,再 LLM 评审,最后才是人工

Airbnb 新发布的工程文章介绍了他们在生产环境里评估生成式 AI 的三层体系:

文中给出了一些很具体的工程标准:他们使用 50–100 条必须包含失败案例的 golden set,要求 judge 与人工的符合度达到 80 多到 90 多,并且每天抽样 5% 的线上流量。更关键的是,Airbnb 承认大约 四分之三 的 LLM 生成参考答案在不同标注轮次里会变,说明他们的评估一度在测自己的噪声。通过缓存相同输出、使用小型 LoRA 适配器,他们把完整评估周期从 数周压到 1 天。

所属事件:Airbnb 公开内部 AI 评测栈:三层架构保障质量(2 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →