Airbnb 揭秘内部 LLM 评测体系:三层架构与防噪实践
iamrobotbear · x · 2026-08-04
Airbnb 分享了其内部运行大模型评测(evals)的工程实践,其架构宛如一份 AI 工程师的岗位说明。
- 三层评测架构:第一层为程序化检查,第二层引入 LLM 作为裁判,第三层仅由人类介入以校准 LLM 裁判。
- 关键指标:使用包含失败案例的 50-100 个黄金数据集(golden sets);要求 LLM 裁判与人类的评分一致性达到 80%-90%(用 Cohen's kappa 衡量);每天采样 5% 的线上真实流量。
- 直面评测噪音:他们坦承,约四分之三由 LLM 生成的参考答案在每次标注运行时都会产生差异,这意味着此前的评测实际上在测量模型自身的噪音。
- 效率飞跃:通过缓存相同输出并训练微型 LoRA 适配器,他们将完整的评测周期从数周大幅缩短至一天。
所属事件:Airbnb 公开内部 AI 评测栈:三层架构保障质量(2 条相关)→
「编程与Agent」频道最新
- 阅读清单串起重构经济学、agent skills 和 Google 实践 — rseroter · 2026-08-04
- Eve 推动企业走向“每家公司一个可定制 agent” — aarthir · 2026-08-04
- Qwen3.8-Max 在盲测编码基准中修复 105 个 bug 里的 19 个 — breath_mirror · 2026-08-04
- 开源工具 Enkstein 统一管控 Codex、Claude、Gemini 和 Ollama — wcoreiron · 2026-08-04
- Gemini Spark 已能接 MCP,但每个工具都得反复授权 — tristanbob · 2026-08-04
- Agent 应用该先暴露技能面,再逐步固化成代码 — burny_tech · 2026-08-04