CANOPY: Adaptive Evidence Compression Cuts Multimodal RAG Tokens Up to 28%
POSTECH · hf · 2026-10-06
CANOPY: Adaptive-Granularity Post-Retrieval Compression
Multimodal RAG retrieves text, tables, images, and videos, but retrieval granularity doesn't decide how much context to keep per item: coarse units include irrelevant content, uniform fine selection may strip needed context. Existing compressors use modality-specific mechanisms, lacking a shared procedure.
POSTECH's CANOPY:
- Represents retrieved items as hierarchies; a node encoder fine-tuned on gold evidence scores regions against the query;
- Parent-relative refinement selects multiple regions at different granularities without LLM calls for pruning;
- A critic triggers targeted follow-up retrieval when accumulated evidence is insufficient; new items are compressed before being added.
Results: across five QA benchmarks over a 33M-item heterogeneous corpus, CANOPY beats retrieval baselines in average accuracy; ablations show follow-up retrieval drives multi-hop gains. In the unrouted Qwen3-VL-8B-Instruct setting, compression cuts reader-input evidence tokens by 14.2–27.7% with comparable accuracy.
More from Research
- Google's SHIFT Builds Per-Query Multi-Agent Harnesses, Beats 17 Baselines by 7.2 Points — google · 2026-10-06
- Diagnosing LLM Math Reasoning: Discovery Is the Bottleneck, and It's Fixable — TexasAMUniversity · 2026-10-06
- RealtimeWAM: One-Step Asynchronous World Action Model Delivers 25x Speedup with <1% Accuracy Loss — NanyangTechnologicalUniversity · 2026-10-06
- OmniConfess: Training-Free Token-Level Confessions Mitigate Omni-Modal Hallucination — Huiqiang Rong · 2026-10-06
- ADSD Framework Uses Auto-Diagnosis to Cut Numerical Solver Error by 71x — Peter Chen · 2026-10-06
- ACG-Bench Probes Dual-Arm VLA Generalization; AE-VLA Lifts Success from 3% to 21.5% — Zaibin Zhang · 2026-10-06