Netflix论文:生产中的AI裁判要像模型一样持续维护

rohanpaul_ai · x · 2026-08-28

Netflix 发表论文《The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations》(arXiv:2608.18300),披露「因为你看过」推荐短句的生成系统:一个 AI 写短句,另一个 AI 打分,人类每周审计。

核心论点是:业界通常把 LLM 裁判验证一次就永久信任,但生产环境中的裁判有生命周期,需像任何模型一样持续维护。Netflix 将其分为四阶段:构建标注样本、调优裁判、作为门控运行、监控漂移。

关键细节:仅检查裁判与人类标注的一致性不够,裁判还须「因与人相同的原因」拒绝坏解释,因此调优基于书面理由而非对错标记;每周人类审核以评分者之间的分歧程度设定标准。在 5 周对照实验中,有解释的版本让会员更多转向未看过的内容,且更多次以播放某个内容结束浏览。

原文链接 →

「应用」频道最新

更多「应用」频道 AI 资讯 →