Airbnb 用重排序得分做 RL 奖励,训练供给侧感知的旅行查询推荐模型 SCOUT
_reachsumit · x · 2026-10-06
Airbnb 团队发布论文 SCOUT,解决旅行搜索中的冷启动主动查询推荐问题。
背景挑战:
- 旅行搜索受物理库存约束:「浪漫海滨别墅」在巴厘岛结果丰富,在东京可能寥寥无几,仅对齐用户偏好并不足以反映可供给的库存。
- 旅行平台传统上用分面搜索界面、无自由文本查询,缺乏历史查询日志,导致冷启动:既没有需求侧数据做对齐,请求时也没有种子查询。
方法:SCOUT 用供给侧系统反馈替代缺失的需求侧用户反馈——把搜索引擎当作强化学习环境,以搜索重排序器的分数作为奖励训练生成式查询推荐模型,使推荐与可用房源对齐,且在服务时无需额外调用。
这是一个将 LLM 生成式查询推荐落地到库存受限搜索场景的工业实践案例。
「研究」频道最新
- AI 宣称证明千年数学难题后,数学家该书作者:这是数学的文艺复兴 — BachFrancis · 2026-10-06
- 训练数据就是语言的「军队」:嘈杂翻译淹没母语文本致 LLM 失真 — yoavgo · 2026-10-06
- 主流 LLM 基准现 110 个新奖励劫持,团队开源 EnvCheck 自动排查 — burny_tech · 2026-10-06
- KAIST 发布 RobotUse:机器人 agent harness 在 RoboLab 达 45% 成功率 — kaist-ai · 2026-10-06
- 闭式权重手术:少量校准样本把 4B 能力移植进 0.8B 模型 — AdventurousTwo6445 · 2026-10-06
- Sander Dieleman 长文:连续扩散语言模型为何卷土重来 — LucaAmb · 2026-10-06