Airbnb 用重排序得分做 RL 奖励,训练供给侧感知的旅行查询推荐模型 SCOUT

_reachsumit · x · 2026-10-06

Airbnb 团队发布论文 SCOUT,解决旅行搜索中的冷启动主动查询推荐问题。

背景挑战:

方法:SCOUT 用供给侧系统反馈替代缺失的需求侧用户反馈——把搜索引擎当作强化学习环境,以搜索重排序器的分数作为奖励训练生成式查询推荐模型,使推荐与可用房源对齐,且在服务时无需额外调用。

这是一个将 LLM 生成式查询推荐落地到库存受限搜索场景的工业实践案例。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →