DAVID-GRPO:低成本 GPU 训练小模型多跳推理

_reachsumit · x · 2026-08-20

论文提出 DAVID-GRPO 方法,通过在强化学习更新中注入少量专家轨迹并奖励证据覆盖率,使得在消费级硬件(4 张 RTX 3090)上即可训练具备多跳推理能力的小型检索 Agent。实验表明,在低预算设置下,该方法在六个多跳问答基准测试中优于先前的 RL 基线。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →