阿里 SSR-GRPO:结合语义 ID 的电商检索 RL 方法

_reachsumit · x · 2026-08-21

阿里巴巴提出了 SSR-GRPO,一种用于电商搜索的强化学习方法。针对现有方法依赖 LLM 作为奖励模型带来的偏见问题,SSR-GRPO 利用语义 ID 和稠密表示向量生成更无偏的相关性分数,并挖掘硬负样本设计掩码函数过滤噪声。该方法通过结合监督检索和语义标识符,提升了复杂隐含语义的处理能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →