EviSD:用证据蒸馏优化搜索智能体动作信用分配
_reachsumit · x · 2026-08-04
论文提出了一个名为 EviSD 的证据条件自蒸馏框架,旨在解决基于结果的强化学习(如 GRPO)在多轮搜索过程中,无法有效区分单个动作贡献的痛点。
核心机制:
- 在训练阶段,模型作为学生从原始上下文中采样动作;同时,同一个模型作为“特权教师”,在注入了支持证据和标准答案的上下文中对这些动作重新打分。
- 将教师与学生的差距转化为有界的修正项,仅应用于生成的动作片段,从而在不改变推理过程的前提下提供局部指导。
实验效果:在 7 个问答基准和 3 种不同规模的主干模型上,EviSD 在所有设置中均取得了最高的宏观平均 Exact Match,比最强基线高出 1.3-2.3 个百分点,且仅调节了 6.7%-15.1% 的 Token。
「编程与Agent」频道最新
- 从GAN到智能体集群:AI老兵12年后再遇“对抗性崩溃” — bingxu_ · 2026-08-04
- 开发社媒发布Agent:API审核才是最大拦路虎 — arslan2012 · 2026-08-04
- Qwen 3.8 编码实测:性能逼近 K3 且价格仅一半 — bindureddy · 2026-08-04
- 破解长程任务智能体状态迷失,新框架让准确率大幅提升 — Ziyu Ma · 2026-08-04
- 告别 Docker:db-here 实现 AI 智能体零风险隔离数据库 — andersonbcdefg · 2026-08-04
- memsem:为 AI Agent 打造的本地化语义记忆 MCP 服务器 — WindSeries · 2026-08-04