DAVID-GRPO Enables Multi-Hop Reasoning on Consumer GPUs

_reachsumit · x · 2026-08-20

This paper introduces David-GRPO, a method that trains small retrieval agents on commodity hardware (e.g., 4x RTX 3090 GPUs) by injecting a few expert trajectories into RL updates and rewarding evidence coverage. Experiments show that under low-budget settings, David-GRPO outperforms prior RL baselines on six multi-hop QA benchmarks.

Original post →

More from coding & agent

coding & agent channel →