ICML 论文:多页检索反损扩散模型准确率,提出免训练过滤框架
_reachsumit · x · 2026-08-10
传统视觉 RAG 通常默认将所有检索到的页面喂给生成器,但本文发现这一设定在扩散语言模型中并不成立。
- 反直觉现象:检索更多页面虽能提升答案召回率,但全部输入给模型反而会因语义冲突导致准确率下降。其根源在于并行去噪过程中,不同位置的提议会将不兼容的视觉源混合成错误答案。
- 解决方案:作者提出了一种免训练的证据准入框架 ECF (Entropy-Based Candidate Filter)。它通过构建多粒度证据单元,并利用空白控制的块置信度和检索排名,在解码前精准筛选出真正有益的上下文。
- 实验效果:在三个多模态 DLM 上的实验表明,该方法成功在保留检索覆盖面的同时,限制了有害的视觉信息干扰。
「研究」频道最新
- 腾讯开源 T-Mem:联想召回记忆架构,LoCoMo-Plus 仅掉 5.45 分 — blaizedsouza · 2026-09-21
- Radial Duality:把约束优化化为无约束 Lipschitz 问题的理论 — prof_grimmer · 2026-09-21
- LoRA 只调局部参数即可替代全量微调,物理模型推断省八成内存 — bravo_abad · 2026-09-21
- Aletheia's Quest 竞赛落幕:19 支团队 478 份提交角逐 5 万美元测谎奖 — gsarti_ · 2026-09-21
- IntBMoE 提出 block 级稀疏执行 MoE,已上线高德推荐服务数亿用户 — Ran Cheng · 2026-09-21
- 干细胞成像模型量化实测:W4/W8 混合压缩 6.76 倍零失败 — capicu-ai · 2026-09-21