IBM提出Q&D训练法:智能体主动追问所需信息,胜过15倍大模型
ibm · hf · 2026-09-30
IBM 研究智能体主动性中被忽视的一维:主动行动的「内容」——该追求哪些用户未要求的信息。
- 定义两种主动性:横向(追求当前上下文已隐含的未言明信息)与纵向(追求只有早期证据才揭示的需求)。
- 提出从 benchmark 自身分解恢复「需求图」,可在对话记录上直接评分,无需模型裁判。
- 训练方法 Q&D(questioner and drafter):训练提问器偏好「继续执行能检索到更多所需证据」的问题,不用奖励模型或裁判。
- 结果:在三个多跳问答 benchmark 的保留集上,同等检索开销下训练后的提问器在两种主动性上均超越同模型 prompt 版,并在 2/3 任务上胜过 15 倍大的模型。
- 无需再训练即部署到客服场景:完成更多任务且提问更少;零售场景以更少追问轮次击败 15 倍大模型。
「编程与Agent」频道最新
- 推理再强数据不行也白搭:Agent 质量取决于信息源 — goyalshaliniuk · 2026-09-30
- 面向研究、销售、SEO 等数据密集场景,Glasser 值得 agent 开发者一试 — goyalshaliniuk · 2026-09-30
- Glasser 技能让 AI Agent 按需调用经核验的高质量数据 — goyalshaliniuk · 2026-09-30
- 免费书签脚本还原 Google 渲染后完整页面 — gaganghotra_ · 2026-09-30
- Dharmamitra Emacs 包更新版已上架 MELPA — SebastianNehrd2 · 2026-09-30
- mitsuhiko 讽刺开放标准现状:理想很开放,现实很骨感 — mitsuhiko · 2026-09-30