阿里 GALA 框架:用强化学习对齐多模态特征提升推荐精度
_reachsumit · x · 2026-08-03
阿里巴巴淘菜菜团队提出 GALA 框架,解决外卖推荐系统中多模态信号与用户行为难以有效融合的痛点。
- 核心创新:在传统两阶段训练中引入“生成式强化学习对齐(GRPO)”中间层,基于转化率构建奖励,动态对齐多模态特征与用户真实购买行为。
- 三阶段流程:行为感知三元组预训练 -> 生成式 RL 对齐 -> 下游任务微调,弥合了语义理解与行为模式的鸿沟。
「研究」频道最新
- 一键生成学术论文:开源工具包实现23阶段全自动研究流程 — tom_doerr · 2026-08-03
- Awesome AI Memory:大模型与智能体记忆系统知识库 — tom_doerr · 2026-08-03
- Google 推出 Science One 框架:构建可信的自主科研智能体 — maier_ak · 2026-08-03
- 亚马逊提出QASP向量搜索策略,大幅减少数据访问 — _reachsumit · 2026-08-03
- GenCDSR:混合分词加速跨域推荐生成 — _reachsumit · 2026-08-03
- Snapchat推出基于LLM的生成式检索系统,用于短视频推荐 — _reachsumit · 2026-08-03