ReWAM:检索反馈驱动多模态嵌入推理,自适应早停加速检索
_reachsumit · x · 2026-09-15
论文 ReWAM 针对通用多模态嵌入(UME)中 CoT 推理的两个部署瓶颈:
- 监督粒度:GRPO 给所有 CoT token 相同优势,未区分有依据的证据——提出检索感知自蒸馏(RASD),构造基于输入证据的特权引导,经策略内自教师蒸馏为 token 级监督。
- 延迟:完整 CoT 才出嵌入代价高——引入检索自适应早停,部分推理链足以支撑检索时提前截断,不损质量。
- 论文来自含淘宝搜索背景的团队,面向语料级检索部署。
「多模态」频道最新
- MiniMax 发布 Design 创作台:一个 brief 驱动 Agent 全流程出片 — Hailuo_AI · 2026-09-15
- Suno 在法庭文件中承认抓取 YouTube 音频训练音乐模型 — emmanuelvivier · 2026-09-15
- 用 Seedance 2.5 生成 30 秒 4K 写实第三人称游戏画面 — SimplyAnnisa · 2026-09-15
- 用 AI 抓取 20 万张 1920 年旧金山老照片拼回整城 — Scobleizer · 2026-09-15
- Seedance 2.5 短片对决:Bryan Fury 大战布洛克·莱斯纳分身 — Ok-Vegetable-2455 · 2026-09-15
- GPT-6 Astra 配 Hyper3D MCP,一张图一条 Agent 直接生成 3D 场景 — heyshrutimishra · 2026-09-15