Doc-REFRAG:粗压缩再选择性展开,多图 RAG 又快又准
_reachsumit · x · 2026-09-01
浙江大学团队(Ruofan Hu 等)发表被 EMNLP 2026 Main 接收的论文,解决现实多图场景下多模态 RAG 精度差、无关视觉 token 计算开销大的问题。
- 发布 DocLongRAG 大规模数据集:34.3 万问答对,平均每题关联 37.4 张检索图像,贴近真实 RAG 工作流
- 提出 Doc-REFRAG:问题引导的框架,先把视觉 token 压缩为粗块,再通过轻量 RL 选择器选择性展开与问题相关的块
- 在 6 个基准上超过 11 个强基线,取得 SOTA 精度且推理延迟显著降低
论文:arXiv:2608.30163,资源已开源。
「研究」频道最新
- 去噪扩散模型与评分匹配的核心原理简述 — ariG23498 · 2026-09-01
- ContextLeak:恶意工具可窃取 Agent 92% 上下文 — rohanpaul_ai · 2026-09-01
- MIT 研究:智能体可通过环境静默协作 — mikeflache · 2026-09-01
- Elastic Triangle Splatting 改进内核函数设计 — zhenjun_zhao · 2026-09-01
- 前馈 3D 重建模型的置信度校准审计 — zhenjun_zhao · 2026-09-01
- ReconSplat 结合扩散先验实现视图外重建 — zhenjun_zhao · 2026-09-01