阿里 SSR-GRPO:结合语义 ID 的电商检索 RL 方法
_reachsumit · x · 2026-08-21
阿里巴巴提出了 SSR-GRPO,一种用于电商搜索的强化学习方法。针对现有方法依赖 LLM 作为奖励模型带来的偏见问题,SSR-GRPO 利用语义 ID 和稠密表示向量生成更无偏的相关性分数,并挖掘硬负样本设计掩码函数过滤噪声。该方法通过结合监督检索和语义标识符,提升了复杂隐含语义的处理能力。
「研究」频道最新
- ShikharMurty:Pass@k 上升不代表模型学到新东西 — ShikharMurty · 2026-08-21
- 生信工具 FasterFASTA:多线程解压提速明显 — viglovikov · 2026-08-21
- 普林斯顿论文:法律搜索基准不适用现实,发布新数据集 — burkov · 2026-08-21
- MIT 论文证伪:从训练集中删除图像不影响模型生成 — technollama · 2026-08-21
- 新期刊将沿用 GEB 编委会,传统出版商价值受疑 — Afinetheorem · 2026-08-21
- 开源 HarnessEval-W:世界模型的 Agentic 评测新范式 — 青稞AI · 2026-08-21