DAVID-GRPO:低成本 GPU 训练小模型多跳推理
_reachsumit · x · 2026-08-20
论文提出 DAVID-GRPO 方法,通过在强化学习更新中注入少量专家轨迹并奖励证据覆盖率,使得在消费级硬件(4 张 RTX 3090)上即可训练具备多跳推理能力的小型检索 Agent。实验表明,在低预算设置下,该方法在六个多跳问答基准测试中优于先前的 RL 基线。
「编程与Agent」频道最新
- 曝 GPT 5.6 Sol 速度达 1400 tokens/s,专家警示工具调用瓶颈 — AccBalanced · 2026-08-20
- UI UX Pro Max v2.0:AI 秒级生成设计系统 — tom_doerr · 2026-08-20
- 开源 MCP 服务器纯解码 Base 交易,无需 LLM 零幻觉 — polaris0028 · 2026-08-20
- Anthropic 工程:85% 员工用图工程运行数百个 Agent — Roger_M_Taylor · 2026-08-20
- TrueFoundry 开源 Agent 框架 TrueForge,解决上下文重复计费问题 — Roger_M_Taylor · 2026-08-20
- Colab 免费炼丹:自研循环 LM 节省 40% 算力 — Flashy-Abalone-9212 · 2026-08-20