谷歌 RPTune:学习式目录精选+后训练,搜索准确率最高提升 31.4 点
google · hf · 2026-10-02
谷歌提出 RPTune,面向目录能塞进长上下文的中小商家,用「全目录提示」替代为百万级商品大市场设计的多阶段检索。但塞进上下文不等于模型能有效利用——LLM 对长上下文的利用并不均匀。RPTune 是端到端框架:编码器-重组器(curator)依据下游 LLM 反馈对商品排序和裁剪,精选后的目录又反过来提升基于上下文相对奖励的 LLM 后训练效果。在 7 家真实商家、每家 100 条复杂对话查询上评测,上下文精选最高带来 31.4 个百分点提升,后训练再平均加 10.3 点,对专有与开源 LLM 均有效。
所属事件:谷歌 RPTune:目录策展加后训练大幅提升 LLM 商品搜索(2 条相关)→
「研究」频道最新
- 自适应努力是动态循环 Transformer 的杀手级应用 — willcb · 2026-10-02
- 华科团队提出 Multimodal Flow:语言与视觉的全连续统一建模 — hustvl · 2026-10-02
- 快手提出 DARA:多奖励 RL 训练步数最多省 65%,代码开源 — kuaishou · 2026-10-02
- Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标 — textql · 2026-10-02
- OpenAI 研究员发布 LoopCD:循环 Transformer 解码免费涨分,AIME 61.9%→73.3% — arankomatsuzaki · 2026-10-02
- Jev 是否在隐式学习价值函数?RL 校准与双系统决策探析 — lateinteraction · 2026-10-02