Amazon's OPERA prunes training data for dense retrievers, doubling efficiency with better recall
_reachsumit · x · 2026-10-01
Amazon Science published OPERA (Optimizing data pruning for efficient retrieval model adaptation), a dynamic data pruning method for fine-tuning dense retrievers. Instead of uniformly using all training pairs, it favors high-quality query-passage pairs during training, improving both ranking quality and recall while cutting training time in half. Paper and code are publicly available.
More from Research
- Blender Bench v1: GPT-6 Astra leads 3D benchmark, Claude Opus 5.5 wins modeling and cloth — yshan2u · 2026-10-01
- Cambridge's SAM-Brain3D surpasses existing methods for early brain disease detection — lawrennd · 2026-10-01
- Protein binding folding models face data starvation after PDB has been fully juiced — anshulkundaje · 2026-10-01
- Stanford's UniEvo-VL Self-Distillation Lifts Qwen-image GenEval From 0.747 to 0.808 — stanfordnlp · 2026-10-01
- NVIDIA's Mid-Harness Scales Actions at the Model-Harness Boundary, Lifting TerminalBench Pass@1 to 68.03% — nvidia · 2026-10-01
- Amazon's SMART Self-Evolving Multi-Agent System Tops All 15 Subtitle Arena Directions, Cuts Penalty 6.9% — amazon · 2026-10-01