Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体
_reachsumit · x · 2026-09-29
论文提出 Dr. Free,首个不依赖难度奖励的自进化搜索智能体训练框架。
- 问题:现有 data-free 自进化方法用「求解器答不对」作为出题质量代理,但难度无法区分需要跨段落证据的题与可走捷径的题;且测难度需对每道候选题多次 rollout,算力开销大。
- 方法:从知识图谱采样关系链并配对相关段落,赋予出题多跳结构;只有当完整证据段落下答案的似然超过所有捷径上下文的最大似然时,题目才获得正的信息增益奖励。
- 收益:奖励信号基于 teacher-forced 似然计算,免去 pass-rate 估计,大幅缩短 proposer 训练时间。
「研究」频道最新
- 千个 AI 智能体 24 小时自动发现病毒中类 CRISPR 新基因系统 — CurieuxExplorer · 2026-09-30
- 470万条解释实验:只审计5%的token位置即可发现prompt注入威胁 — aisilab · 2026-09-30
- 南洋理工 PerF:像素空间扩散DiT按特征分层精炼,FID低至1.63 — NanyangTechnologicalUniversity · 2026-09-30
- IBM提出Q&D训练法:智能体主动追问所需信息,胜过15倍大模型 — ibm · 2026-09-30
- 研究者预测:AI 将速通数学猜想,转向材料与药物发现 — tak3sh8 · 2026-09-30
- Stephen Wright 等三套机器学习优化公开课视频上线,覆盖大步长与隐式偏差 — caglar_ee · 2026-09-30